Perintah Deskripsi dan Pemberian Keterangan Gambar
Arahkan fokus model pada objek, hubungan, suasana, dan detail teknis.
Perintah Deskripsi dan Pemberian Keterangan Gambar adalah pelajaran AI Prompt Engineering gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Prompt Engineering, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Prompt Engineering mencakup 4 pelajaran total.
Model Visi dan Prompting
Model bahasa visi (VLM) seperti GPT-4o dan Claude dapat memproses gambar bersama teks. Prompt yang Anda kirimkan bersama gambar sangat memengaruhi kualitas, fokus, dan format deskripsi model.
Tanpa prompt pengarah, model menentukan sendiri apa yang akan dideskripsikan—yang mungkin tidak sesuai dengan kebutuhan Anda. Prompt deskripsi terstruktur memberi tahu model secara tepat elemen mana yang harus diperhatikan dan cara mengatur keluarannya.
Mengirim Gambar dengan Prompt
API Anthropic menerima gambar sebagai konten berkode base64 atau URL. Berikut struktur dasarnya:
import anthropic, base64
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open('image.jpg', 'rb') as f:
image_data = base64.standard_b64encode(f.read()).decode('utf-8')
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=500,
messages=[{
'role': 'user',
'content': [
{
'type': 'image',
'source': {
'type': 'base64',
'media_type': 'image/jpeg',
'data': image_data
}
},
{
'type': 'text',
'text': 'Describe this image in detail.'
}
]
}]
)
print(response.content[0].text)Prompt Deskripsi Tidak Terstruktur
Prompt paling sederhana—Deskripsikan gambar ini—menghasilkan keluaran yang sepenuhnya dibentuk oleh prioritas model. Untuk banyak kasus penggunaan, ini tidak memadai:
- Model mungkin berfokus pada elemen yang paling mencolok secara visual, bukan yang paling relevan
- Panjang dan susunan deskripsi dapat sangat berbeda pada gambar yang serupa
- Detail penting (teks, objek kecil, konteks latar belakang) sering dihilangkan
Prompt deskripsi terstruktur mengatasi semua masalah ini.
Deskripsi Terstruktur: Mengarahkan Perhatian
Prompt deskripsi terstruktur secara eksplisit mengarahkan perhatian model ke elemen visual tertentu:
structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:
1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression
Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''
print(structured_prompt)Mengontrol Panjang Deskripsi
Gambar yang sama mungkin memerlukan panjang deskripsi yang berbeda untuk kasus penggunaan yang berbeda. Kendalikan panjangnya secara eksplisit dalam prompt:
# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''
# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''
# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''
print('Three length-controlled description prompts defined.')Prompt Deskripsi Khusus Domain
Domain yang berbeda memerlukan kosakata deskriptif dan area fokus yang berbeda:
# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''
# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''
# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''
print('Domain-specific prompts defined.')Keluaran Terstruktur dari Deskripsi Gambar
Untuk pipeline otomatis, minta keluaran JSON terstruktur dari deskripsi gambar, bukan prosa:
json_description_prompt = '''
Analyze this product image and return a JSON description:
{
"product_name": "inferred product name or null",
"category": "electronics|clothing|furniture|food|other",
"colors": ["primary color", "secondary color"],
"condition": "new|used|unclear",
"background": "white|lifestyle|outdoor|studio|other",
"people_visible": true | false,
"text_visible": "extracted text or null",
"quality_score": 1-10,
"caption": "one sentence product caption"
}
Return only the JSON object.
'''
print(json_description_prompt)Deskripsi yang Berfokus pada Aksesibilitas
Menulis deskripsi gambar untuk aksesibilitas memerlukan gaya prompt tertentu yang memprioritaskan informasi bagi pengguna dengan gangguan penglihatan:
accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.
Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''
print(accessibility_prompt)Menghindari Kesalahan Umum dalam Prompt Deskripsi
Kesalahan umum dalam prompt deskripsi gambar dan cara memperbaikinya:
- Terlalu samar: Deskripsikan gambar → Perbaikan: tentukan elemen yang harus dideskripsikan
- Tanpa format: Model menulis prosa saat Anda membutuhkan JSON → Perbaikan: tentukan format keluaran secara eksplisit
- Tanpa batas panjang: Model menulis 1.000 kata → Perbaikan: tentukan panjang target
- Tanpa fokus: Semua elemen dideskripsikan secara setara → Perbaikan: tentukan elemen utama
- Tanpa konteks domain: Deskripsi umum untuk gambar khusus → Perbaikan: sertakan kosakata domain dan kriteria fokus
Pipeline Deskripsi Gambar Batch
Untuk memproses beberapa gambar dalam pipeline otomatis:
import anthropic, base64, json
from pathlib import Path
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''
def describe_image(image_path):
with open(image_path, 'rb') as f:
img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
r = client.messages.create(
model='claude-opus-4-5', max_tokens=200,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
{'type': 'text', 'text': DESCRIPTION_PROMPT}
]}]
)
return json.loads(r.content[0].text)
print('Batch image description pipeline defined.')Menguji Kualitas Prompt Deskripsi
Uji prompt deskripsi pada kumpulan gambar yang beragam untuk memastikan cakupan dan konsistensi:
- Produk sederhana dengan latar belakang putih
- Foto gaya hidup dengan beberapa orang
- Dokumen atau papan tanda dengan teks padat
- Gambar gelap atau berkualitas rendah
- Konten abstrak atau ambigu
Untuk setiap gambar uji, pastikan keluaran mencakup semua elemen yang diperlukan, mematuhi batas panjang, dan menggunakan format yang diwajibkan. Sesuaikan prompt jika kategori mana pun secara sistematis gagal.
Pemeriksaan Cepat
Apa manfaat utama prompt deskripsi gambar terstruktur dibandingkan prompt sederhana “Deskripsikan gambar ini”?
Prompt Deskripsi Gambar — Inti Pembelajaran
Prompt deskripsi gambar terstruktur sangat penting untuk menghasilkan keluaran AI visual yang konsisten dan bermanfaat:
- Sebutkan secara eksplisit elemen visual yang harus dideskripsikan (latar depan, latar belakang, warna, suasana, teks, orang)
- Tentukan format keluaran—prosa, JSON, atau judul bagian tertentu
- Kendalikan panjang secara eksplisit—sesuaikan panjang dengan kasus penggunaan (keterangan 15 kata dibandingkan analisis 250 kata)
- Prompt khusus domain (medis, real estat, keamanan) memerlukan kosakata domain dan kriteria fokus
- Untuk aksesibilitas, prioritaskan informasi daripada estetika dan sertakan semua teks yang terlihat secara verbatim
- Uji pada beragam jenis gambar: produk, gaya hidup, penuh teks, berkualitas rendah, dan abstrak
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Perintah Deskripsi dan Pemberian Keterangan Gambar” gratis?
Ya — teks lengkap “Perintah Deskripsi dan Pemberian Keterangan Gambar” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Prompt Engineering, upgrade ke CoddyKit PRO. Kursus AI Prompt Engineering mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Perintah Deskripsi dan Pemberian Keterangan Gambar”?
Arahkan fokus model pada objek, hubungan, suasana, dan detail teknis. Kamu berlatih AI Prompt Engineering dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Prompt Engineering?
Tidak diperlukan pengalaman sebelumnya. AI Prompt Engineering di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.
Berapa lama pelajaran “Perintah Deskripsi dan Pemberian Keterangan Gambar” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Prompt Engineering ini?
Ya. Setiap pelajaran AI Prompt Engineering menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Perintah Deskripsi dan Pemberian Keterangan Gambar
- Penjawaban Pertanyaan Visual
- Perintah Perbandingan Banyak Gambar
- Perintah OCR dan Analisis Dokumen