Metin ve Görselleri Birleştirme
Birleşik çok kipli istemler.
Metin ve Görselleri Birleştirme, CoddyKit'te ücretsiz bir AI Prompt Engineering dersidir. Bu, 4 dersinin 1. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Prompt Engineering öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Prompt Engineering kursu toplamda 4 dersten oluşur.
Birleşik Çok Modlu İstem
Çok modlu bir istem, metin ile eklenmiş bir görüntünün toplamı değildir. Görüntü belirteçleri ile metin belirteçlerinin aynı bağlamda yer aldığı ve birbirini dikkate aldığı tek bir iç içe geçmiş dizidir. Model 'önce görüntüye bakıp sonra metni okumaz'; birleşik bir belirteç akışını işler.
- Görüntü parçaları, metin belirteçleriyle aynı gömme uzayına yansıtılır.
- Sıralama önemlidir: bir soru görüntüden önce yerleştirildiğinde, görüntüden sonra yerleştirilen bir sorudan farklı bir dikkat düzeni oluşturur.
- İki istem değil, iki yüzey biçimine sahip tek bir istem yazıyorsunuz.
Araya Yerleştirme Sırası ve Sabitleme
Görüntüyü yönergeye göre nereye yerleştirdiğiniz davranışı değiştirir. Yönergeyi görüntünün sonrasına yerleştirmek, modelin soruyu daha önce kodladığı içeriğe göre yorumlamasını sağlar; yönergeyi görüntünün önüne yerleştirmek ise görüntüyü önceden belirtilen görev için kanıta dönüştürür.
Çok görüntülü istemlerde, daha sonraki metnin görüntülere açıkça başvurabilmesi için her görüntüyü istem içinde etiketleyin ([Image 1], [Image 2]).
messages = [
{'role': 'user', 'content': [
{'type': 'text', 'text': 'You will see two product photos.'},
{'type': 'text', 'text': 'Image 1:'},
{'type': 'image', 'source': img_a},
{'type': 'text', 'text': 'Image 2:'},
{'type': 'image', 'source': img_b},
{'type': 'text', 'text': 'Which has better lighting? Cite the image label.'}
]}
]Kodlamadan Önce Görevi Çerçeveleme
Görsel kodlayıcılar kayıplıdır: örtük görevle ilgili olmayan ayrıntılar havuzlama sırasında atılabilir. Görevi görüntüden önce belirtirseniz, modeli önemli bölgelere dikkat etmeye yönlendirirsiniz.
- Genel açıklama istekleri genel özellikler üretir.
- Belirli bir soru ('kart üzerindeki dirençleri sayın'), temsili bütçeyi ilgili alt bölgelere odaklar.
İnce ayrıntı gerektiğinde özgüllüğü en başta belirtin.
Çözünürlük ve Döşeme Bütçeleri
Çoğu görsel model, yüksek çözünürlüklü görüntüleri her biri belirteç maliyeti oluşturan sabit boyutlu parçalara böler. 2000x2000 boyutundaki bir görüntü, her biri küçültülen çok sayıda parçaya ayrılabilir. Belirteç bütçesi, çok kipli istem oluşturmanın sessiz kısıtıdır.
- Göndermeden önce ilgi bölgesini kırpın — modelin yakınlaştırmasına güvenmeyin.
- Yoğun belgeler için tek bir tam sayfa görüntüsü yerine sayfa kırpmalarını gönderin.
- Sağlayıcınızın izin verdiği en fazla parça sayısını bilin; bu sınır aşıldığında küçük metinler okunamaz hâle gelir.
def estimate_image_tokens(w, h, tile=512, per_tile=256):
import math
tiles = math.ceil(w / tile) * math.ceil(h / tile)
return tiles * per_tile + per_tile # + thumbnailGörüntü İçin Yapılandırılmış Şema Olarak Metin
Görüntüyü, metin kanalında açık bir çıktı şemasıyla birleştirin. Görüntü içeriği sağlar; metin ise sözleşmeyi tanımlar. Bu yaklaşım, serbest biçimli açıklamadan çok daha güvenilirdir.
Görmeyi beklediğiniz varlıkları anahtar alan JSON isteyin ve görünmeyen alanlar için null döndürmesini söyleyin — bu, uydurulmuş ayrıntıları bastırır.
instruction = (
'Extract from the receipt image. Return JSON: '
'{"merchant": str|null, "total": number|null, '
'"date": str|null, "line_items": [{"name": str, "price": number}]}. '
'Use null when a field is not legible. Do not invent values.'
)İşaret Gösterimleriyle Belirsizliği Giderme
İşaret gösteren göndermeler ('bu', 'soldaki', 'vurgulanmış kutu'), metni görüntü bölgelerine bağlar. Görüntüye önceden açıklama ekleyebildiğinizde (bir kutu çizmek veya ok eklemek), metindeki gönderme tek başına kullanılan mekânsal dilden çok daha sağlam olur.
- Mekânsal ifadeler ('sağ üst'), döndürme veya kırpma durumunda hataya açıktır.
- Görüntünün üzerine yerleştirilmiş numaralı bir işaret ile 'nesne #3' ifadesi belirsizliği ortadan kaldırır.
- İşaretler eklemek için görüntüyü önceden işlemek, geçerli bir istem mühendisliği yaklaşımıdır.
Karışık Kiplerle Birkaç Örnek Kullanma
Biçimi ve akıl yürütme tarzını sabitlemek için görüntüden metne örnekler sağlayabilirsiniz. Her örnek, dönüşümlü bir (görüntü, ideal yanıt) çiftidir. Model, gösterimlerden eşlemeyi çıkarır.
Örnek görüntülerin gerçek veri dağılımını temsil etmesini sağlayın — farklı bir alandan alınan bir örnek, yanlış özellik seçimini öğretir.
shots = [
('image', chart_a), ('text', 'Trend: upward. Peak: Q3. Anomaly: none.'),
('image', chart_b), ('text', 'Trend: flat. Peak: Q1. Anomaly: Q4 dip.'),
('image', target_chart), ('text', 'Trend:') # model completes
]İddiaları Piksellere Dayandırma
Kritik çıkarımlarda, modelin her iddianın görüntünün neresinden kaynaklandığını belirtmesini isteyin. Yaklaşık sınırlayıcı kutular veya görüntü üzerindeki alıntılanmış metin, doğrulanabilir kanıt görevi görür ve kendinden emin uydurmaları büyük ölçüde azaltır.
- 'Her değer için okuduğunuz etiket metnini tam olarak alıntılayın.'
- 'Her alan için yaklaşık normalleştirilmiş bir [x0,y0,x1,y1] kutusu verin.'
Dayanaklandırma, opak bir yanıtı denetlenebilir bir yanıta dönüştürür.
Dikkat Edilmesi Gereken Hata Biçimleri
Çok kipli modeller belirli biçimlerde başarısız olur:
- Küçük veya stilize yazı tiplerinde OCR kayması — 1/7 ve 0/O gibi rakamlar karıştırılır.
- Yaklaşık 6 benzer nesneyi aştığında sayımın çökmesi.
- Açıklama yanlılığı: gerçek sahne yerine tipik sahnenin açıklanması.
- Metin kanalının baskın çıkması: kendinden emin, yanlış bir metin iddiasının doğru görsel kanıtı bastırması.
Modelden önce görüntüden çıkarım yapmasını, ardından metin iddialarıyla uzlaştırmasını isteyerek bu sorunları azaltın.
Uzlaştırma İstemleri
Metin bağlamı ile görüntü çeliştiğinde, önceliği açıkça belirlemelisiniz — modelin güvenebileceğiniz varsayılan bir ilkesi yoktur. Şunu belirtin: 'Görüntü, sağlanan üstveriyle çelişiyorsa görüntüye güvenin ve tutarsızlığı işaretleyin.'
Bu tek cümle, sessiz bir hatayı sonraki işlem hattınızın incelemeye yönlendirebileceği açık ve görünür bir çelişkiye dönüştürür.
policy = (
'You are given metadata AND a photo. '
'When they disagree, prefer the photo as ground truth. '
'Emit {"value": ..., "conflict": bool, "note": str}.'
)Birleştirme İşlem Hattısını Tasarlama
Üretim ortamında çok kipli istem oluşturma tek bir çağrıdan ibaret değil, bir işlem hattıdır:
- Ön işleme: bütçeye uygun olacak şekilde kırpın, açıklama ekleyin ve küçültün.
- Birleştirme: görev öncelikli bir talimatı ve çıktı şemasını dönüşümlü olarak ekleyin.
- Dayanaklandırma: her iddia için kanıt isteyin.
- Uzlaştırma: kipler arasındaki önceliği belirtin.
- Doğrulama: JSON'u ayrıştırın, boş değerleri ve çelişki işaretlerini kontrol edin.
Her aşama, yalnızca istem oluşturmanın azaltamayacağı hata yüzeyini küçültür.
Hızlı Kontrol
Yüksek çözünürlüklü bir sözleşme taramasından küçük yazıları çıkarmanız ve güvenilir sayılara ihtiyaç duymanız gerekiyor.
Özet: Metin ve Görüntüleri Birleştirme
Birleşik çok kipli istem, dönüşümlü tek bir belirteç akışıdır. Temel yaklaşımlar şunlardır: görsel kodlayıcıyı yönlendirmek için görev öncelikli çerçeveleme, kırpma yoluyla çözünürlük ve döşeme farkındalığı, boş bırakılabilen alanlara sahip açık çıktı şemaları, her iddia için piksel dayanaklandırması ve çelişkilerde kipler arası önceliğin belirtilmesi. Bunu bir işlem hattı olarak ele alın — ön işleme, birleştirme, dayanaklandırma, uzlaştırma, doğrulama — böylece görsel istem oluşturmanın kırılgan bölümleri denetlenebilir hâle gelir.
Yapay zeka eğitmeniyle AI Prompt Engineering öğren — ücretsiz
Tarayıcında gerçek kod yaz ve çalıştır, 7/24 yapay zeka eğitmeninden anında yardım al; web'de ya da uygulamada kaldığın yerden devam et.
- Kurslar
- 53
- Dersler
- 199
Sıkça Sorulan Sorular
“Metin ve Görselleri Birleştirme” dersi ücretsiz mi?
Evet — “Metin ve Görselleri Birleştirme” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Prompt Engineering kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Prompt Engineering kursu toplamda 4 dersten oluşur.
“Metin ve Görselleri Birleştirme” dersinde ne öğreneceğim?
Birleşik çok kipli istemler. AI Prompt Engineering ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
AI Prompt Engineering öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te AI Prompt Engineering, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 1. dersidir.
“Metin ve Görselleri Birleştirme” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu AI Prompt Engineering dersinde kod yazıp çalıştırabilir miyim?
Evet. Her AI Prompt Engineering dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- Metin ve Görselleri Birleştirme
- Kipler Arasında Temellendirme
- Ses, Metin ve Görüntüyü Birlikte Kullanma
- Çok Kipli Çıktı Denetimi