Görüntü Açıklama ve Altyazı İstemleri
Modelin odağını yönlendirin: nesneler, ilişkiler, ruh hâli ve teknik ayrıntılar.
Görüntü Açıklama ve Altyazı İstemleri, CoddyKit'te ücretsiz bir AI Prompt Engineering dersidir. Bu, 4 dersinin 1. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Prompt Engineering öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Prompt Engineering kursu toplamda 4 dersten oluşur.
Görsel Modeller ve İstem Oluşturma
GPT-4o ve Claude gibi görsel dil modelleri (VLM'ler), metinle birlikte görüntüleri işleyebilir. Bir görüntüyle birlikte gönderdiğiniz istem, modelin açıklamasının kalitesini, odağını ve biçimini büyük ölçüde etkiler.
Yönlendirici bir istem olmadan model neyi açıklayacağına kendisi karar verir; bu da ihtiyacınız olanla örtüşmeyebilir. Yapılandırılmış bir açıklama istemi, modele tam olarak hangi unsurlara odaklanacağını ve çıktısını nasıl düzenleyeceğini söyler.
İstemle Görüntü Gönderme
Anthropic API, görüntüleri base64 ile kodlanmış içerik veya URL'ler olarak kabul eder. Temel yapı şöyledir:
import anthropic, base64
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open('image.jpg', 'rb') as f:
image_data = base64.standard_b64encode(f.read()).decode('utf-8')
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=500,
messages=[{
'role': 'user',
'content': [
{
'type': 'image',
'source': {
'type': 'base64',
'media_type': 'image/jpeg',
'data': image_data
}
},
{
'type': 'text',
'text': 'Describe this image in detail.'
}
]
}]
)
print(response.content[0].text)Yapılandırılmamış Açıklama İstemi
En basit istem olan Bu görüntüyü açıklayın, tamamen modelin önceliklerine göre şekillenen bir çıktı üretir. Bu, birçok kullanım alanı için yetersizdir:
- Model, en alakalı unsura değil, görsel açıdan en çarpıcı unsura odaklanabilir
- Benzer görüntülerde açıklamaların uzunluğu ve düzeni büyük ölçüde değişebilir
- Önemli ayrıntılar (metin, küçük nesneler, arka plan bağlamı) çoğu zaman atlanır
Yapılandırılmış açıklama istemleri tüm bu sorunları çözer.
Yapılandırılmış Açıklama: Dikkati Yönlendirme
Yapılandırılmış bir açıklama istemi, modelin dikkatini belirli görsel unsurlara açıkça yönlendirir:
structured_prompt = '''
Describe this image in detail, addressing each of the following aspects:
1. FOREGROUND: Main subjects and objects in the foreground
2. BACKGROUND: Setting, environment, and background elements
3. COLORS: Dominant color palette and notable color contrasts
4. MOOD: Emotional tone, atmosphere, and lighting
5. TEXT: Any visible text, signs, labels, or written content
6. PEOPLE: If people are present — count, approximate age, pose, expression
Organize your response using these exact section headers.
Be specific and descriptive. Avoid vague terms like "some" or "various".
'''
print(structured_prompt)Açıklama Uzunluğunu Denetleme
Aynı görüntü, farklı kullanım alanları için farklı uzunluklarda açıklamalar gerektirebilir. İstemde uzunluğu açıkça denetleyin:
# For image captions in a product catalog
short_prompt = '''
Write a 1-sentence product image caption (under 15 words).
Focus on the product, its key feature, and setting.
'''
# For accessibility alt-text
alt_text_prompt = '''
Write an image alt-text description for a visually impaired user.
Limit: 125 characters.
Include: what the image shows, any text visible in the image, the most important action or emotion.
'''
# For detailed analysis
detailed_prompt = '''
Write a detailed image analysis of 200-300 words.
Cover: composition, subjects, setting, colors, mood, and any notable technical or artistic elements.
Structure as a single flowing paragraph.
'''
print('Three length-controlled description prompts defined.')Alana Özgü Açıklama İstemleri
Farklı alanlar, farklı açıklayıcı sözcük dağarcıkları ve odak alanları gerektirir:
# Medical imaging description
medical_prompt = '''
Describe the key visual findings in this medical image.
Focus on: anatomical structures visible, any abnormalities or anomalies,
location using standard anatomical terms (left/right, superior/inferior, medial/lateral),
and image quality or artifacts.
Note: this description is for informational purposes only, not diagnostic.
'''
# Architecture / real estate
architecture_prompt = '''
Describe this property image for a real estate listing.
Cover: room type, approximate size, key features (flooring, ceiling, natural light),
condition, notable fixtures or finishes, and overall style.
Tone: professional, appealing, factual.
'''
# Security / surveillance
security_prompt = '''
Describe this security camera image.
Note: number of people, approximate location in frame, clothing colors,
any objects being carried, direction of movement, and time of day if discernible.
'''
print('Domain-specific prompts defined.')Görüntü Açıklamalarından Yapılandırılmış Çıktı
Otomatik işlem hatları için görüntü açıklamasından düzyazı yerine yapılandırılmış JSON çıktısı isteyin:
json_description_prompt = '''
Analyze this product image and return a JSON description:
{
"product_name": "inferred product name or null",
"category": "electronics|clothing|furniture|food|other",
"colors": ["primary color", "secondary color"],
"condition": "new|used|unclear",
"background": "white|lifestyle|outdoor|studio|other",
"people_visible": true | false,
"text_visible": "extracted text or null",
"quality_score": 1-10,
"caption": "one sentence product caption"
}
Return only the JSON object.
'''
print(json_description_prompt)Erişilebilirlik Odaklı Açıklama
Erişilebilirlik için görüntü açıklamaları yazmak, görme engelli kullanıcılar için bilgileri önceliklendiren belirli bir istem biçimi gerektirir:
accessibility_prompt = '''
Write an image description optimized for screen reader accessibility.
Guidelines:
- Start with the most important content (what is this image about?)
- Describe spatial relationships (the man on the left, the building in the background)
- Include all visible text verbatim
- Describe faces and expressions if relevant to the content
- Skip decorative descriptions unless they convey meaning
- End with: if this is a graph or chart, include the key data it shows
- Maximum 250 characters for alt-text. If more is needed, write a 1-sentence alt-text plus a longer caption.
'''
print(accessibility_prompt)Yaygın Açıklama İstemi Hatalarından Kaçınma
Görüntü açıklaması istemlerindeki yaygın hatalar ve bunların nasıl düzeltileceği:
- Çok muğlak: Görüntüyü açıklayın → Düzeltme: açıklanacak unsurları belirtin
- Biçim yok: İhtiyacınız JSON iken model düzyazı yazar → Düzeltme: çıktı biçimini açıkça belirtin
- Uzunluk sınırı yok: Model 1000 kelime yazar → Düzeltme: hedef uzunluğu belirtin
- Odak yok: Tüm unsurlar eşit şekilde açıklanır → Düzeltme: hangi unsurun birincil olduğunu belirtin
- Alan bağlamı yok: Uzmanlık gerektiren bir görüntü için genel açıklama → Düzeltme: alanın kelime dağarcığını ve odak ölçütlerini ekleyin
Toplu Görüntü Açıklama İşlem Hattı
Otomatik bir işlem hattında birden çok görüntüyü işlemek için:
import anthropic, base64, json
from pathlib import Path
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
DESCRIPTION_PROMPT = '''
Describe this image for a product catalog.
Return JSON: {"caption": str, "colors": [str], "category": str, "alt_text": str}
'''
def describe_image(image_path):
with open(image_path, 'rb') as f:
img_b64 = base64.standard_b64encode(f.read()).decode('utf-8')
r = client.messages.create(
model='claude-opus-4-5', max_tokens=200,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/jpeg', 'data': img_b64}},
{'type': 'text', 'text': DESCRIPTION_PROMPT}
]}]
)
return json.loads(r.content[0].text)
print('Batch image description pipeline defined.')Açıklama İstemi Kalitesini Sınama
Kapsamı ve tutarlılığı güvence altına almak için açıklama istemlerini çeşitli görüntülerden oluşan bir kümede sınayın:
- Beyaz arka planda basit bir ürün
- Birden çok kişinin bulunduğu yaşam tarzı fotoğrafı
- Yoğun metin içeren belge veya tabela
- Karanlık veya düşük kaliteli görüntü
- Soyut veya muğlak içerik
Her sınama görüntüsü için çıktının gerekli tüm unsurları kapsadığını, uzunluk kısıtlarına uyduğunu ve gerekli biçimi kullandığını doğrulayın. Herhangi bir kategorinin sistematik olarak başarısız olduğu durumlarda istemi ayarlayın.
Hızlı Kontrol
Basit 'Bu görüntüyü açıklayın' istemine kıyasla yapılandırılmış bir görüntü açıklama isteminin temel yararı nedir?
Görüntü Açıklama İstemleri — Temel Çıkarımlar
Yapılandırılmış görüntü açıklama istemleri, tutarlı ve kullanışlı görsel yapay zekâ çıktıları için vazgeçilmezdir:
- Hangi görsel unsurların açıklanacağını açıkça listeleyin (ön plan, arka plan, renkler, ruh hâli, metin, kişiler)
- Çıktı biçimini belirtin — düzyazı, JSON veya belirli bölüm başlıkları
- Uzunluğu açıkça denetleyin — uzunluğu kullanım alanına uygun hâle getirin (15 kelimelik alt yazı ve 250 kelimelik analiz)
- Alana özgü istemler (tıbbi, gayrimenkul, güvenlik), alanın kelime dağarcığını ve odak ölçütlerini gerektirir
- Erişilebilirlik için estetikten çok bilgiyi önceliklendirin ve görünen tüm metni kelimesi kelimesine ekleyin
- Çeşitli görüntü türleriyle sınayın: ürün, yaşam tarzı, yoğun metinli, düşük kaliteli, soyut
Yapay zeka eğitmeniyle AI Prompt Engineering öğren — ücretsiz
Tarayıcında gerçek kod yaz ve çalıştır, 7/24 yapay zeka eğitmeninden anında yardım al; web'de ya da uygulamada kaldığın yerden devam et.
- Kurslar
- 53
- Dersler
- 199
Sıkça Sorulan Sorular
“Görüntü Açıklama ve Altyazı İstemleri” dersi ücretsiz mi?
Evet — “Görüntü Açıklama ve Altyazı İstemleri” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Prompt Engineering kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Prompt Engineering kursu toplamda 4 dersten oluşur.
“Görüntü Açıklama ve Altyazı İstemleri” dersinde ne öğreneceğim?
Modelin odağını yönlendirin: nesneler, ilişkiler, ruh hâli ve teknik ayrıntılar. AI Prompt Engineering ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
AI Prompt Engineering öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te AI Prompt Engineering, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 1. dersidir.
“Görüntü Açıklama ve Altyazı İstemleri” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu AI Prompt Engineering dersinde kod yazıp çalıştırabilir miyim?
Evet. Her AI Prompt Engineering dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- Görüntü Açıklama ve Altyazı İstemleri
- Görsel Soru Yanıtlama
- Birden Çok Görüntüyü Karşılaştırma İstemleri
- OCR ve Belge Analizi İstemleri