พรอมป์ตสำหรับการบรรยายและใส่คำบรรยายภาพ
กำหนดจุดเน้นของโมเดล: วัตถุ ความสัมพันธ์ อารมณ์ และรายละเอียดทางเทคนิค
พรอมป์ตสำหรับการบรรยายและใส่คำบรรยายภาพ เป็นบทเรียน AI Prompt Engineering ฟรีบน CoddyKit นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Prompt Engineering และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Prompt Engineering มีบทเรียนทั้งหมด 4 บทเรียน
โมเดลการมองเห็นและการเขียนพรอมป์ต์
โมเดลภาษาด้านการมองเห็น (VLM) เช่น GPT-4o และ Claude สามารถประมวลผลรูปภาพควบคู่กับข้อความได้ พรอมป์ต์ที่ส่งไปพร้อมรูปภาพมีผลอย่างมากต่อคุณภาพ จุดเน้น และ format ของคำอธิบายจากโมเดล
หากไม่มีพรอมป์ต์ชี้นำ โมเดลจะตัดสินใจเองว่าจะอธิบายอะไร ซึ่งอาจไม่ตรงกับสิ่งที่ต้องการ พรอมป์ต์คำอธิบายแบบมีโครงสร้างจะบอกโมเดลอย่างชัดเจนว่าควรใส่ใจกับองค์ประกอบใดและควรจัดระเบียบเอาต์พุตอย่างไร
การส่งรูปภาพพร้อมพรอมป์ต์
API ของ Anthropic รองรับรูปภาพในรูปแบบเนื้อหาที่เข้ารหัสเป็น base64 หรือ URL ต่อไปนี้คือโครงสร้างพื้นฐาน:
import anthropic, base64
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open('image.jpg', 'rb') as f:
image_data = base64.standard_b64encode(f.read()).decode('utf-8')
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=500,
messages=[{
'role': 'user',
'content': [
{
'type': 'image',
'source': {
'type': 'base64',
'media_type': 'image/jpeg',
'data': image_data
}
},
{
'type': 'text',
'text': 'Describe this image in detail.'
}
]
}]
)
print(response.content[0].text)พรอมป์ต์คำอธิบายแบบไม่มีโครงสร้าง
พรอมป์ต์ที่เรียบง่ายที่สุดอย่าง อธิบายรูปภาพนี้ จะสร้างเอาต์พุตที่ขึ้นอยู่กับลำดับความสำคัญของโมเดลทั้งหมด สำหรับกรณีใช้งานจำนวนมาก วิธีนี้ยังไม่เพียงพอ:
- โมเดลอาจมุ่งความสนใจไปที่องค์ประกอบที่โดดเด่นทางสายตามากที่สุด แทนที่จะเป็นองค์ประกอบที่เกี่ยวข้องที่สุด
- ความยาวและการจัดระเบียบของคำอธิบายอาจแตกต่างกันมาก แม้เป็นรูปภาพที่คล้ายกัน
- รายละเอียดสำคัญ เช่น ข้อความ วัตถุขนาดเล็ก และบริบทของฉากหลัง มักถูกละไว้
พรอมป์ต์คำอธิบายแบบมีโครงสร้างช่วยแก้ปัญหาเหล่านี้ได้ทั้งหมด
คำอธิบายแบบมีโครงสร้าง: การกำหนดจุดสนใจ
พรอมป์ต์คำอธิบายแบบมีโครงสร้างจะกำหนดจุดสนใจของโมเดลไปยังองค์ประกอบทางภาพที่เฉพาะเจาะจงอย่างชัดเจน:
structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:
1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression
Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''
print(structured_prompt)การควบคุมความยาวคำอธิบาย
รูปภาพเดียวกันอาจต้องใช้คำอธิบายที่มีความยาวแตกต่างกันสำหรับกรณีใช้งานที่ต่างกัน จึงควรกำหนดความยาวอย่างชัดเจนในพรอมป์ต์:
# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''
# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''
# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''
print('Three length-controlled description prompts defined.')พรอมป์ต์คำอธิบายเฉพาะโดเมน
แต่ละโดเมนต้องใช้คำศัพท์และจุดเน้นในการอธิบายที่แตกต่างกัน:
# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''
# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''
# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''
print('Domain-specific prompts defined.')เอาต์พุตแบบมีโครงสร้างจากคำอธิบายรูปภาพ
สำหรับกระบวนการอัตโนมัติ ควรขอเอาต์พุต JSON แบบมีโครงสร้างจากคำอธิบายรูปภาพแทนการเขียนเป็นร้อยแก้ว:
json_description_prompt = '''
Analyze this product image and return a JSON description:
{
"product_name": "inferred product name or null",
"category": "electronics|clothing|furniture|food|other",
"colors": ["primary color", "secondary color"],
"condition": "new|used|unclear",
"background": "white|lifestyle|outdoor|studio|other",
"people_visible": true | false,
"text_visible": "extracted text or null",
"quality_score": 1-10,
"caption": "one sentence product caption"
}
Return only the JSON object.
'''
print(json_description_prompt)คำอธิบายที่เน้นการเข้าถึง
การเขียนคำอธิบายรูปภาพเพื่อการเข้าถึงจำเป็นต้องใช้รูปแบบพรอมป์ต์เฉพาะที่ให้ความสำคัญกับข้อมูลสำหรับผู้ใช้ที่มีความบกพร่องทางการมองเห็น:
accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.
Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''
print(accessibility_prompt)การหลีกเลี่ยงข้อผิดพลาดทั่วไปของพรอมป์ต์คำอธิบาย
ข้อผิดพลาดทั่วไปในพรอมป์ต์คำอธิบายรูปภาพและวิธีแก้ไข:
- กำกวมเกินไป: อธิบายรูปภาพ → วิธีแก้: ระบุองค์ประกอบที่ต้องการให้บรรยาย
- ไม่มี format: โมเดลเขียนเป็นร้อยแก้วทั้งที่ต้องการ JSON → วิธีแก้: ระบุ format ของเอาต์พุตอย่างชัดเจน
- ไม่มีการจำกัดความยาว: โมเดลเขียน 1,000 คำ → วิธีแก้: ระบุความยาวเป้าหมาย
- ไม่มีจุดเน้น: อธิบายองค์ประกอบทั้งหมดเท่า ๆ กัน → วิธีแก้: ระบุว่าองค์ประกอบใดเป็นองค์ประกอบหลัก
- ไม่มีบริบทของโดเมน: ใช้คำอธิบายทั่วไปกับรูปภาพเฉพาะทาง → วิธีแก้: ใส่คำศัพท์ของโดเมนและเกณฑ์การกำหนดจุดเน้น
กระบวนการจัดการคำอธิบายรูปภาพแบบกลุ่ม
สำหรับการประมวลผลรูปภาพหลายรูปในกระบวนการอัตโนมัติ:
import anthropic, base64, json
from pathlib import Path
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''
def describe_image(image_path):
with open(image_path, 'rb') as f:
img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
r = client.messages.create(
model='claude-opus-4-5', max_tokens=200,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
{'type': 'text', 'text': DESCRIPTION_PROMPT}
]}]
)
return json.loads(r.content[0].text)
print('Batch image description pipeline defined.')การทดสอบคุณภาพพรอมป์ต์คำอธิบาย
ทดสอบพรอมป์ต์คำอธิบายกับชุดรูปภาพที่หลากหลาย เพื่อให้ครอบคลุมและมีความสม่ำเสมอ:
- ผลิตภัณฑ์เรียบง่ายบนฉากหลังสีขาว
- ภาพถ่ายวิถีชีวิตที่มีคนหลายคน
- เอกสารหรือป้ายที่มีข้อความหนาแน่น
- รูปภาพมืดหรือคุณภาพต่ำ
- เนื้อหาเชิงนามธรรมหรือกำกวม
สำหรับรูปภาพทดสอบแต่ละรูป ให้ตรวจสอบว่าเอาต์พุตครอบคลุมองค์ประกอบที่จำเป็นทั้งหมด เป็นไปตามข้อจำกัดด้านความยาว และใช้ format ที่กำหนด ปรับพรอมป์ต์เมื่อหมวดหมู่ใดล้มเหลวซ้ำ ๆ อย่างเป็นระบบ
ตรวจสอบอย่างรวดเร็ว
ประโยชน์หลักของพรอมป์ต์คำอธิบายรูปภาพแบบมีโครงสร้างเมื่อเทียบกับพรอมป์ต์อย่าง “อธิบายรูปภาพนี้” คืออะไร
พรอมป์ต์คำอธิบายรูปภาพ — ประเด็นสำคัญ
พรอมป์ต์คำอธิบายรูปภาพแบบมีโครงสร้างมีความสำคัญต่อการสร้างเอาต์พุตจาก AI ด้านภาพที่สม่ำเสมอและมีประโยชน์:
- ระบุองค์ประกอบทางภาพที่ต้องการให้บรรยายอย่างชัดเจน เช่น ฉากหน้า ฉากหลัง สี อารมณ์ ข้อความ และผู้คน
- ระบุ format ของเอาต์พุต เช่น ร้อยแก้ว JSON หรือหัวข้อส่วนที่กำหนดโดยเฉพาะ
- ควบคุมความยาวอย่างชัดเจนให้เหมาะกับกรณีใช้งาน เช่น คำบรรยาย 15 คำเทียบกับการวิเคราะห์ 250 คำ
- พรอมป์ต์เฉพาะโดเมน เช่น การแพทย์ อสังหาริมทรัพย์ และความปลอดภัย จำเป็นต้องใช้คำศัพท์ของโดเมนและเกณฑ์การกำหนดจุดเน้น
- สำหรับการเข้าถึง ให้ความสำคัญกับข้อมูลมากกว่าสุนทรียภาพ และใส่ข้อความที่มองเห็นทั้งหมดตามต้นฉบับ
- ทดสอบกับรูปภาพหลากหลายประเภท ได้แก่ ผลิตภัณฑ์ วิถีชีวิต รูปภาพที่มีข้อความมาก รูปภาพคุณภาพต่ำ และรูปภาพเชิงนามธรรม
เรียนรู้ AI Prompt Engineering ด้วย AI tutor — ฟรี
เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป
- คอร์ส
- 53
- บทเรียน
- 199
คำถามที่พบบ่อย
บทเรียน “พรอมป์ตสำหรับการบรรยายและใส่คำบรรยายภาพ” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “พรอมป์ตสำหรับการบรรยายและใส่คำบรรยายภาพ” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Prompt Engineering ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Prompt Engineering มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “พรอมป์ตสำหรับการบรรยายและใส่คำบรรยายภาพ”
กำหนดจุดเน้นของโมเดล: วัตถุ ความสัมพันธ์ อารมณ์ และรายละเอียดทางเทคนิค คุณปฏิบัติ AI Prompt Engineering ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Prompt Engineering หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Prompt Engineering บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน
บทเรียน “พรอมป์ตสำหรับการบรรยายและใส่คำบรรยายภาพ” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน AI Prompt Engineering นี้ได้ไหม
ได้ บทเรียน AI Prompt Engineering ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- พรอมป์ตสำหรับการบรรยายและใส่คำบรรยายภาพ
- การตอบคำถามด้วยภาพ
- พรอมป์ตสำหรับเปรียบเทียบหลายภาพ
- พรอมป์ตสำหรับ OCR และการวิเคราะห์เอกสาร