AI Prompt Engineering · บทเรียน

พรอมป์ตสำหรับการบรรยายและใส่คำบรรยายภาพ

กำหนดจุดเน้นของโมเดล: วัตถุ ความสัมพันธ์ อารมณ์ และรายละเอียดทางเทคนิค

บทเรียน 1 จาก 413 ขั้นตอน

พรอมป์ตสำหรับการบรรยายและใส่คำบรรยายภาพ เป็นบทเรียน AI Prompt Engineering ฟรีบน CoddyKit นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Prompt Engineering และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Prompt Engineering มีบทเรียนทั้งหมด 4 บทเรียน

โมเดลการมองเห็นและการเขียนพรอมป์ต์

โมเดลภาษาด้านการมองเห็น (VLM) เช่น GPT-4o และ Claude สามารถประมวลผลรูปภาพควบคู่กับข้อความได้ พรอมป์ต์ที่ส่งไปพร้อมรูปภาพมีผลอย่างมากต่อคุณภาพ จุดเน้น และ format ของคำอธิบายจากโมเดล

หากไม่มีพรอมป์ต์ชี้นำ โมเดลจะตัดสินใจเองว่าจะอธิบายอะไร ซึ่งอาจไม่ตรงกับสิ่งที่ต้องการ พรอมป์ต์คำอธิบายแบบมีโครงสร้างจะบอกโมเดลอย่างชัดเจนว่าควรใส่ใจกับองค์ประกอบใดและควรจัดระเบียบเอาต์พุตอย่างไร

การส่งรูปภาพพร้อมพรอมป์ต์

API ของ Anthropic รองรับรูปภาพในรูปแบบเนื้อหาที่เข้ารหัสเป็น base64 หรือ URL ต่อไปนี้คือโครงสร้างพื้นฐาน:

import anthropic, base64

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

with open('image.jpg', 'rb') as f:
    image_data = base64.standard_b64encode(f.read()).decode('utf-8')

response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=500,
    messages=[{
        'role': 'user',
        'content': [
            {
                'type': 'image',
                'source': {
                    'type': 'base64',
                    'media_type': 'image/jpeg',
                    'data': image_data
                }
            },
            {
                'type': 'text',
                'text': 'Describe this image in detail.'
            }
        ]
    }]
)
print(response.content[0].text)

พรอมป์ต์คำอธิบายแบบไม่มีโครงสร้าง

พรอมป์ต์ที่เรียบง่ายที่สุดอย่าง อธิบายรูปภาพนี้ จะสร้างเอาต์พุตที่ขึ้นอยู่กับลำดับความสำคัญของโมเดลทั้งหมด สำหรับกรณีใช้งานจำนวนมาก วิธีนี้ยังไม่เพียงพอ:

  • โมเดลอาจมุ่งความสนใจไปที่องค์ประกอบที่โดดเด่นทางสายตามากที่สุด แทนที่จะเป็นองค์ประกอบที่เกี่ยวข้องที่สุด
  • ความยาวและการจัดระเบียบของคำอธิบายอาจแตกต่างกันมาก แม้เป็นรูปภาพที่คล้ายกัน
  • รายละเอียดสำคัญ เช่น ข้อความ วัตถุขนาดเล็ก และบริบทของฉากหลัง มักถูกละไว้

พรอมป์ต์คำอธิบายแบบมีโครงสร้างช่วยแก้ปัญหาเหล่านี้ได้ทั้งหมด

คำอธิบายแบบมีโครงสร้าง: การกำหนดจุดสนใจ

พรอมป์ต์คำอธิบายแบบมีโครงสร้างจะกำหนดจุดสนใจของโมเดลไปยังองค์ประกอบทางภาพที่เฉพาะเจาะจงอย่างชัดเจน:

structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:

1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression

Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''

print(structured_prompt)

การควบคุมความยาวคำอธิบาย

รูปภาพเดียวกันอาจต้องใช้คำอธิบายที่มีความยาวแตกต่างกันสำหรับกรณีใช้งานที่ต่างกัน จึงควรกำหนดความยาวอย่างชัดเจนในพรอมป์ต์:

# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''

# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''

# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''

print('Three length-controlled description prompts defined.')

พรอมป์ต์คำอธิบายเฉพาะโดเมน

แต่ละโดเมนต้องใช้คำศัพท์และจุดเน้นในการอธิบายที่แตกต่างกัน:

# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''

# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''

# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''

print('Domain-specific prompts defined.')

เอาต์พุตแบบมีโครงสร้างจากคำอธิบายรูปภาพ

สำหรับกระบวนการอัตโนมัติ ควรขอเอาต์พุต JSON แบบมีโครงสร้างจากคำอธิบายรูปภาพแทนการเขียนเป็นร้อยแก้ว:

json_description_prompt = '''
Analyze this product image and return a JSON description:
{
  "product_name": "inferred product name or null",
  "category": "electronics|clothing|furniture|food|other",
  "colors": ["primary color", "secondary color"],
  "condition": "new|used|unclear",
  "background": "white|lifestyle|outdoor|studio|other",
  "people_visible": true | false,
  "text_visible": "extracted text or null",
  "quality_score": 1-10,
  "caption": "one sentence product caption"
}
Return only the JSON object.
'''

print(json_description_prompt)

คำอธิบายที่เน้นการเข้าถึง

การเขียนคำอธิบายรูปภาพเพื่อการเข้าถึงจำเป็นต้องใช้รูปแบบพรอมป์ต์เฉพาะที่ให้ความสำคัญกับข้อมูลสำหรับผู้ใช้ที่มีความบกพร่องทางการมองเห็น:

accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.

Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''

print(accessibility_prompt)

การหลีกเลี่ยงข้อผิดพลาดทั่วไปของพรอมป์ต์คำอธิบาย

ข้อผิดพลาดทั่วไปในพรอมป์ต์คำอธิบายรูปภาพและวิธีแก้ไข:

  • กำกวมเกินไป: อธิบายรูปภาพ → วิธีแก้: ระบุองค์ประกอบที่ต้องการให้บรรยาย
  • ไม่มี format: โมเดลเขียนเป็นร้อยแก้วทั้งที่ต้องการ JSON → วิธีแก้: ระบุ format ของเอาต์พุตอย่างชัดเจน
  • ไม่มีการจำกัดความยาว: โมเดลเขียน 1,000 คำ → วิธีแก้: ระบุความยาวเป้าหมาย
  • ไม่มีจุดเน้น: อธิบายองค์ประกอบทั้งหมดเท่า ๆ กัน → วิธีแก้: ระบุว่าองค์ประกอบใดเป็นองค์ประกอบหลัก
  • ไม่มีบริบทของโดเมน: ใช้คำอธิบายทั่วไปกับรูปภาพเฉพาะทาง → วิธีแก้: ใส่คำศัพท์ของโดเมนและเกณฑ์การกำหนดจุดเน้น

กระบวนการจัดการคำอธิบายรูปภาพแบบกลุ่ม

สำหรับการประมวลผลรูปภาพหลายรูปในกระบวนการอัตโนมัติ:

import anthropic, base64, json
from pathlib import Path

client = anthropic.Anthropic(api_key='YOUR_API_KEY')

DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''

def describe_image(image_path):
    with open(image_path, 'rb') as f:
        img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
    r = client.messages.create(
        model='claude-opus-4-5', max_tokens=200,
        messages=[{'role': 'user', 'content': [
            {'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
            {'type': 'text', 'text': DESCRIPTION_PROMPT}
        ]}]
    )
    return json.loads(r.content[0].text)

print('Batch image description pipeline defined.')

การทดสอบคุณภาพพรอมป์ต์คำอธิบาย

ทดสอบพรอมป์ต์คำอธิบายกับชุดรูปภาพที่หลากหลาย เพื่อให้ครอบคลุมและมีความสม่ำเสมอ:

  • ผลิตภัณฑ์เรียบง่ายบนฉากหลังสีขาว
  • ภาพถ่ายวิถีชีวิตที่มีคนหลายคน
  • เอกสารหรือป้ายที่มีข้อความหนาแน่น
  • รูปภาพมืดหรือคุณภาพต่ำ
  • เนื้อหาเชิงนามธรรมหรือกำกวม

สำหรับรูปภาพทดสอบแต่ละรูป ให้ตรวจสอบว่าเอาต์พุตครอบคลุมองค์ประกอบที่จำเป็นทั้งหมด เป็นไปตามข้อจำกัดด้านความยาว และใช้ format ที่กำหนด ปรับพรอมป์ต์เมื่อหมวดหมู่ใดล้มเหลวซ้ำ ๆ อย่างเป็นระบบ

ตรวจสอบอย่างรวดเร็ว

ประโยชน์หลักของพรอมป์ต์คำอธิบายรูปภาพแบบมีโครงสร้างเมื่อเทียบกับพรอมป์ต์อย่าง “อธิบายรูปภาพนี้” คืออะไร

พรอมป์ต์คำอธิบายรูปภาพ — ประเด็นสำคัญ

พรอมป์ต์คำอธิบายรูปภาพแบบมีโครงสร้างมีความสำคัญต่อการสร้างเอาต์พุตจาก AI ด้านภาพที่สม่ำเสมอและมีประโยชน์:

  • ระบุองค์ประกอบทางภาพที่ต้องการให้บรรยายอย่างชัดเจน เช่น ฉากหน้า ฉากหลัง สี อารมณ์ ข้อความ และผู้คน
  • ระบุ format ของเอาต์พุต เช่น ร้อยแก้ว JSON หรือหัวข้อส่วนที่กำหนดโดยเฉพาะ
  • ควบคุมความยาวอย่างชัดเจนให้เหมาะกับกรณีใช้งาน เช่น คำบรรยาย 15 คำเทียบกับการวิเคราะห์ 250 คำ
  • พรอมป์ต์เฉพาะโดเมน เช่น การแพทย์ อสังหาริมทรัพย์ และความปลอดภัย จำเป็นต้องใช้คำศัพท์ของโดเมนและเกณฑ์การกำหนดจุดเน้น
  • สำหรับการเข้าถึง ให้ความสำคัญกับข้อมูลมากกว่าสุนทรียภาพ และใส่ข้อความที่มองเห็นทั้งหมดตามต้นฉบับ
  • ทดสอบกับรูปภาพหลากหลายประเภท ได้แก่ ผลิตภัณฑ์ วิถีชีวิต รูปภาพที่มีข้อความมาก รูปภาพคุณภาพต่ำ และรูปภาพเชิงนามธรรม
เริ่มต้นได้ฟรี

เรียนรู้ AI Prompt Engineering ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
53
บทเรียน
199

คำถามที่พบบ่อย

บทเรียน “พรอมป์ตสำหรับการบรรยายและใส่คำบรรยายภาพ” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “พรอมป์ตสำหรับการบรรยายและใส่คำบรรยายภาพ” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Prompt Engineering ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Prompt Engineering มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “พรอมป์ตสำหรับการบรรยายและใส่คำบรรยายภาพ”

กำหนดจุดเน้นของโมเดล: วัตถุ ความสัมพันธ์ อารมณ์ และรายละเอียดทางเทคนิค คุณปฏิบัติ AI Prompt Engineering ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Prompt Engineering หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Prompt Engineering บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน

บทเรียน “พรอมป์ตสำหรับการบรรยายและใส่คำบรรยายภาพ” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Prompt Engineering นี้ได้ไหม

ได้ บทเรียน AI Prompt Engineering ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. พรอมป์ตสำหรับการบรรยายและใส่คำบรรยายภาพ
  2. การตอบคำถามด้วยภาพ
  3. พรอมป์ตสำหรับเปรียบเทียบหลายภาพ
  4. พรอมป์ตสำหรับ OCR และการวิเคราะห์เอกสาร
← กลับไปที่ AI Prompt Engineering