Ses, Metin ve Görüntüyü Birlikte Kullanma
Birden fazla girdiyi eşgüdümleme.
Ses, Metin ve Görüntüyü Birlikte Kullanma, CoddyKit'te ücretsiz bir AI Prompt Engineering dersidir. Bu, 4 dersinin 3. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Prompt Engineering öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Prompt Engineering kursu toplamda 4 dersten oluşur.
Üç Kanal, Tek Bağlam
Ses, metin ve görüntüyü koordine etmek, üç girdi akışını tek ve tutarlı bir bağlamda düzenlemek anlamına gelir. Her kipin farklı bir belirteç maliyeti, doğruluk profili ve hata biçimi vardır — yine de model bunları tek bir dikkat alanında birleştirir.
- Ses: zamansal, sıralı, sıkıştırma altında kayıplı.
- Görüntü: mekânsal, döşeme bütçeli, ayrıntılara karşı hassas.
- Metin: kesin ve ucuzdur, ancak diğerlerini geçersiz kılabilir.
İşin püf noktası, her birinin geri kalanını bastırmak yerine birbirini güçlendireceği şekilde sıralamaktır.
Kip Çorbası Değil, Kip Rolleri
İstemde her girdiye açık bir rol atayın. Hangi kanalın yetkili olduğu konusundaki belirsizlik, çalıştırmalar arasında tutarsız yanıtlar üretilmesine neden olur.
- Görüntü = gösterilenler için temel gerçek.
- Ses dökümü = gösterilenler hakkında söylenenler.
- Metin talimatı = görev sözleşmesi ve öncelik kuralları.
Çelişki durumunda hangi kaynağın üstün olduğunu modelin bilmesi için rolleri en başta belirtin.
header = (
'INPUTS: (1) a video frame [authoritative for visible state], '
'(2) an audio transcript [authoritative for spoken intent], '
'(3) this instruction [defines the task]. '
'On conflict, prefer the frame for state and the transcript for intent.'
)Sesi Karelerle Hizalama
Ses ve görüntü zamansal olarak hizalanmalıdır; aksi hâlde model yanlış sözcükleri yanlış görüntüyle ilişkilendirir. Açık bir hizalama sağlayın: dökümün ve karelerin zaman damgalarını ekleyin, ardından modelin bunları zamana göre birleştirmesine izin verin.
Hizalama üstverisi olmadan model eşlemeyi tahmin eder — gevşek görevler için kabul edilebilir, eşzamanlı analiz için ise felaket niteliğindedir.
payload = {
'frames': [{'t': 0.0, 'image': f0}, {'t': 2.5, 'image': f1}],
'transcript': [
{'start': 0.0, 'end': 2.4, 'text': 'Now I tighten the bolt.'},
{'start': 2.5, 'end': 5.0, 'text': 'It is fully seated.'}
]
}Önceden Döküm Alma ve Ham Ses
Ham sesi yerel bir ses modeline aktarabilir veya özel bir ASR adımıyla önceden döküme çevirip metni aktarabilirsiniz. Her iki yaklaşımın da ödünleşimleri vardır.
- Ham ses: ezgiyi, tonlamayı ve üst üste binen konuşmaları korur — ancak daha fazla belirteç maliyeti oluşturur ve dayanaklandırılması daha zordur.
- Önceden döküme çevrilmiş ses: ucuzdur ve zaman damgasıyla kaynak gösterilebilir, ancak söz dışı ipuçlarını (alaycılık, aciliyet) atar.
Göreve göre seçim yapın: duygu/niyet -> ham ses; olgusal çıkarım -> döküm.
Dönüşümlü Akışı Sıralama
Kanal dizisinin oluşturulma sırası, dikkati şekillendirir. Analiz görevleri için sağlam bir varsayılan sıra şöyledir:
- Görev sözleşmesi ve roller (metin).
- Her biri etiketlenmiş ve zaman damgası eklenmiş görsel kanıt (kareler).
- Zaman damgası eklenmiş ses dökümü.
- Etiketlere ve zamanlara gönderme yapan belirli soru (metin).
Soruyu en sona koymak, önceden kodlanmış her şeye dikkat etmesini sağlar.
Belirteç Bütçesi Önceliklendirmesi
Üç kanal tek bir bağlam penceresi için yarışır. Maliyette görüntü baskındır; sıkıştırılmamış ses ikinci sıradadır. Göndermeden önce önceliklendirme yapın:
- Kareleri görevin gerektirdiği sıklıkta örnekleyin; her kareyi değil.
- Kareleri eylem bölgesine göre kırpın.
- Sesi ilgili bölümlere ayırın; sessizliği atın.
Bütçeyi yanıtın bulunduğu yere ayırın.
def select_frames(frames, fps_target, src_fps):
step = max(1, round(src_fps / fps_target))
return frames[::step]Kipler Arası Doğrulama
Çoklu girdili istem oluşturmanın en büyük getirisi doğrulamadır: aynı olgu iki kanaldan bağımsız olarak çıkarılabiliyorsa, uyuşma güçlü bir kanıttır ve uyuşmazlık ciddi bir uyarıdır.
Modelden her temel olguyu kanal başına çıkarmasını ve tek birleştirilmiş yanıta indirgemek yerine uyuşmayı bildirmesini isteyin; böylece hangi kaynağa güvendiği gizlenmez.
ask = (
'For each claim report: from_vision, from_audio, agree(bool). '
'If only one channel supports it, say which and lower confidence.'
)Eksik veya Bozulmuş Kanalları Ele Alma
Gerçek girdiler bozulabilir: boğuk bir klip, bulanık bir kare, kesilmiş bir döküm. Eksik kanalı uydurmasına izin vermek yerine, modele kısmi kanıtla nasıl ilerleyeceğini söyleyin.
- 'Bir bölüm boyunca ses anlaşılamıyorsa [INAUDIBLE] olarak işaretleyin.'
- 'Bir kare okunamayacak kadar bulanıksa, ilgili alan için OKUNAMIYOR döndürün.'
Kontrollü bozulma, sessizce bilgi uydurmaktan iyidir.
Konuşmacı ve Nesne Ortak Gönderimi
Zor çok kipli görevlerde kimin konuştuğunu (ses ayrıştırma) kimin görünür olduğunu (görüntü) ilişkilendirmek gerekir. Ortak gönderimi açıkça belirtin: modelden, zamanlama ve dudak hareketi veya jest gibi görünür ipuçlarını kullanarak konuşmacı etiketlerini karedeki kişilerle eşleştirmesini isteyin.
Her eşleştirmeyi hem bir zaman damgası hem de görsel bir ipucuyla gerekçelendirmesini zorunlu kılın.
binding = {
'speaker': 'S1', 'person_box': [0.1,0.2,0.4,0.9],
'evidence': 'lips move during 3.2-4.1s; gestures while speaking'
}Çıktı: Birleştirilmiş ama İzlenebilir Yanıt
Son yanıt okunabilirlik için birleştirilmeli, ancak temelinde kanal bazında izlenebilirliği korumalıdır. Yapılandırılmış bir nesne üretin: sentezlenmiş sonuç ile her kipten gelen destekleyici kanıtı, zaman damgası veya kutusuyla birlikte verin.
Bu sayede insanlar kullanışlı özeti kabul ederken, tek bir iddiayı kaynak kanalına kadar denetleyebilir.
out = {
'summary': 'The technician seated the bolt correctly.',
'evidence': [
{'modality': 'vision', 'box': [0.3,0.4,0.6,0.7], 't': 2.5},
{'modality': 'audio', 'quote': 'It is fully seated.', 't': 3.0}
]
}Orkestrasyon Kontrol Listesi
Herhangi bir üç kipli çağrıdan önce şunları doğrulayın:
- Roller ve öncelik sırası belirtilmiş.
- Karelere ve döküme zaman damgası eklenmiş ve hizalanmış.
- Kanallar bütçeye sığacak şekilde önceliklendirilmiş.
- Doğrulama ve uyuşmazlık işaretleme istenmiş.
- Bozulma belirteçleri tanımlanmış (INAUDIBLE, OKUNAMIYOR).
- Çıktı birleştirilmiş, ancak kanıtı izlenebilir.
Her madde, çoklu girdilerin birleştirilmesindeki belirli bir hata biçimini giderir.
Hızlı Kontrol
Bir öğretici videoyu analiz ediyorsunuz ve anlatıcının sözlü iddiasının her adımda ekrandaki eylemle eşleşip eşleşmediğini bilmeniz gerekiyor.
Özet: Birden Çok Girdiyi Koordine Etme
Üç kipli istem oluşturma; açık kanal rolleri ve öncelik sırası belirlediğinizde, ses ile kareleri zaman damgalarıyla hizaladığınızda, her kanalı bütçeye sığacak şekilde önceliklendirdiğinizde ve eksik kanıt için bozulma belirteçleriyle birlikte kanal bazında doğrulama istediğinizde başarılı olur. Ham ses ile önceden oluşturulmuş döküm arasında, ses tonlamasının önemli olup olmadığına göre karar verin. Okunması kolay, ancak her iddiayı bir kutuya veya zaman damgasına kadar izleyebilen birleştirilmiş bir özet sunun.
Sıkça Sorulan Sorular
“Ses, Metin ve Görüntüyü Birlikte Kullanma” dersi ücretsiz mi?
Evet — “Ses, Metin ve Görüntüyü Birlikte Kullanma” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Prompt Engineering kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Prompt Engineering kursu toplamda 4 dersten oluşur.
“Ses, Metin ve Görüntüyü Birlikte Kullanma” dersinde ne öğreneceğim?
Birden fazla girdiyi eşgüdümleme. AI Prompt Engineering ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
AI Prompt Engineering öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te AI Prompt Engineering, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 3. dersidir.
“Ses, Metin ve Görüntüyü Birlikte Kullanma” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu AI Prompt Engineering dersinde kod yazıp çalıştırabilir miyim?
Evet. Her AI Prompt Engineering dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- Metin ve Görselleri Birleştirme
- Kipler Arasında Temellendirme
- Ses, Metin ve Görüntüyü Birlikte Kullanma
- Çok Kipli Çıktı Denetimi