0Pricing
AI Prompt Engineering · Pelajaran

Audio, Teks, dan Penglihatan Bersama

Mengoordinasikan berbagai masukan.

Audio, Teks, dan Penglihatan Bersama adalah pelajaran AI Prompt Engineering gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Prompt Engineering, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Prompt Engineering mencakup 4 pelajaran total.

Tiga Kanal, Satu Konteks

Mengoordinasikan audio, teks, dan visi berarti mengatur tiga aliran input menjadi satu konteks yang koheren. Setiap modalitas memiliki biaya token, profil fidelitas, dan mode kegagalan yang berbeda — namun model memadukannya dalam satu ruang perhatian.

  • Audio: temporal, berurutan, mengalami kehilangan informasi saat dikompresi.
  • Visi: spasial, dibatasi anggaran petak, detailnya rapuh.
  • Teks: presisi, murah, tetapi dapat menimpa yang lain.

Keahliannya adalah mengurutkan semuanya agar masing-masing saling memperkuat, bukan menenggelamkan yang lain.

Peran Modalitas, Bukan Campur Aduk Modalitas

Tetapkan peran eksplisit untuk setiap input dalam prompt. Ketidakjelasan mengenai kanal mana yang menjadi acuan utama menghasilkan jawaban yang tidak konsisten antarpenggunaan.

  • Visi = fakta dasar tentang apa yang ditampilkan.
  • Transkrip audio = apa yang dikatakan tentangnya.
  • Instruksi teks = kontrak tugas dan aturan prioritas.

Nyatakan peran sejak awal agar model mengetahui sumber mana yang menang saat terjadi konflik.

header = (
  'INPUTS: (1) a video frame [authoritative for visible state], '
  '(2) an audio transcript [authoritative for spoken intent], '
  '(3) this instruction [defines the task]. '
  'On conflict, prefer the frame for state and the transcript for intent.'
)

Menyelaraskan Audio dengan Bingkai

Audio dan visi harus diselaraskan secara temporal; jika tidak, model akan mengaitkan kata yang salah dengan gambar yang salah. Sediakan penyelarasan eksplisit: beri cap waktu pada transkrip dan bingkai, lalu biarkan model menggabungkannya berdasarkan waktu.

Tanpa metadata penyelarasan, model menebak pemetaannya — cukup untuk tugas yang longgar, tetapi fatal untuk analisis tersinkronisasi.

payload = {
  'frames': [{'t': 0.0, 'image': f0}, {'t': 2.5, 'image': f1}],
  'transcript': [
    {'start': 0.0, 'end': 2.4, 'text': 'Now I tighten the bolt.'},
    {'start': 2.5, 'end': 5.0, 'text': 'It is fully seated.'}
  ]
}

Pratranskripsi atau Audio Mentah

Anda dapat meneruskan audio mentah ke model audio bawaan, atau melakukan pratranskripsi dengan langkah ASR khusus lalu meneruskan teks. Keduanya memiliki kelebihan dan kekurangan.

  • Audio mentah: mempertahankan prosodi, nada, dan percakapan yang tumpang tindih — tetapi memerlukan lebih banyak token dan lebih sulit ditautkan ke bukti.
  • Hasil pratranskripsi: murah dan dapat dikutip berdasarkan cap waktu, tetapi membuang isyarat nonleksikal (sarkasme, urgensi).

Pilih berdasarkan tugas: emosi/maksud -> audio mentah; ekstraksi faktual -> transkrip.

Mengurutkan Penyisipan Berselang-seling

Urutan kemunculan kanal membentuk perhatian. Bawaan yang kuat untuk tugas analisis:

  1. Kontrak tugas dan peran (teks).
  2. Bukti visual (bingkai), masing-masing diberi label dan cap waktu.
  3. Transkrip audio, dengan cap waktu.
  4. Pertanyaan spesifik (teks), yang merujuk pada label dan waktu.

Menempatkan pertanyaan di bagian terakhir memungkinkannya memperhatikan semua hal yang telah dikodekan sebelumnya.

Penentuan Prioritas Anggaran Token

Tiga saluran bersaing untuk satu jendela konteks. Visi paling banyak menghabiskan biaya; audio yang tidak dikompresi berada di urutan kedua. Tentukan prioritas sebelum mengirim:

  • Ambil sampel bingkai dengan laju yang dibutuhkan tugas — bukan setiap bingkai.
  • Pangkas bingkai hingga hanya menyisakan wilayah tindakan.
  • Segmentasikan audio menjadi bagian-bagian yang relevan; buang keheningan.

Gunakan anggaran pada bagian yang memuat jawaban.

def select_frames(frames, fps_target, src_fps):
    step = max(1, round(src_fps / fps_target))
    return frames[::step]

Penguatan Silang Antar-Modalitas

Manfaat terbesar dari pemberian perintah dengan banyak masukan adalah penguatan: ketika fakta yang sama dapat diturunkan secara independen dari dua saluran, kesesuaian menjadi bukti kuat dan ketidaksesuaian menjadi tanda bahaya.

Minta model menurunkan setiap fakta penting untuk tiap saluran dan melaporkan kesesuaiannya, alih-alih menggabungkannya menjadi satu jawaban terpadu yang menyembunyikan sumber mana yang dipercayainya.

ask = (
  'For each claim report: from_vision, from_audio, agree(bool). '
  'If only one channel supports it, say which and lower confidence.'
)

Menangani Saluran yang Hilang atau Menurun Kualitasnya

Masukan nyata dapat menurun kualitasnya: klip yang teredam, bingkai yang buram, transkrip yang terpotong. Beri tahu model cara melanjutkan dengan bukti parsial, alih-alih membiarkannya mengarang saluran yang hilang.

  • 'Jika audio tidak dapat dipahami pada suatu bagian, tandai sebagai [INAUDIBLE].'
  • 'Jika suatu bingkai terlalu buram untuk dibaca, kembalikan TIDAK_TERBACA untuk bidang tersebut.'

Penurunan kualitas yang ditangani dengan baik lebih baik daripada mengarang secara diam-diam.

Koreferensi Pembicara dan Objek

Tugas multimodal yang sulit mengharuskan Anda menghubungkan siapa yang berbicara (diarisasi audio) dengan siapa yang terlihat (visi). Nyatakan koreferensi secara eksplisit: minta model memetakan label pembicara ke orang-orang dalam bingkai menggunakan waktu serta petunjuk visual seperti gerakan bibir atau gestur.

Paksa model memberikan alasan untuk setiap pemetaan dengan cap waktu dan petunjuk visual.

binding = {
  'speaker': 'S1', 'person_box': [0.1,0.2,0.4,0.9],
  'evidence': 'lips move during 3.2-4.1s; gestures while speaking'
}

Keluaran: Jawaban Terpadu yang Dapat Ditelusuri

Jawaban akhir sebaiknya dipadukan agar mudah dibaca, tetapi tetap mempertahankan keterlacakan per saluran di baliknya. Keluarkan objek terstruktur: kesimpulan yang disintesis beserta bukti pendukung dari setiap modalitas, lengkap dengan cap waktu atau kotaknya.

Dengan begitu, manusia dapat menerima ringkasan yang praktis sekaligus mengaudit setiap klaim hingga kembali ke saluran sumbernya.

out = {
  'summary': 'The technician seated the bolt correctly.',
  'evidence': [
    {'modality': 'vision', 'box': [0.3,0.4,0.6,0.7], 't': 2.5},
    {'modality': 'audio', 'quote': 'It is fully seated.', 't': 3.0}
  ]
}

Daftar Periksa Orkestrasi

Sebelum panggilan tri-modal apa pun, pastikan:

  • Peran dan urutan prioritas dinyatakan.
  • Bingkai dan transkrip diberi cap waktu serta diselaraskan.
  • Saluran diprioritaskan agar sesuai dengan anggaran.
  • Penguatan dan penandaan ketidaksesuaian diminta.
  • Token penurunan kualitas ditentukan (INAUDIBLE, TIDAK_TERBACA).
  • Keluaran dipadukan, tetapi buktinya tetap dapat ditelusuri.

Setiap butir menutup mode kegagalan tertentu dalam penggabungan banyak masukan.

Pemeriksaan Singkat

Anda sedang menganalisis video tutorial dan perlu mengetahui apakah klaim yang diucapkan narator sesuai dengan tindakan di layar pada setiap langkah.

Rangkuman: Mengoordinasikan Banyak Masukan

Pemberian perintah tri-modal berhasil jika Anda menetapkan peran dan urutan prioritas saluran secara eksplisit, menyelaraskan audio dan bingkai berdasarkan cap waktu, memprioritaskan setiap saluran agar sesuai dengan anggaran, serta meminta penguatan per saluran dengan token penurunan kualitas untuk bukti yang hilang. Pilih audio mentah atau pratranskripsi berdasarkan penting tidaknya prosodi. Sajikan ringkasan terpadu yang tetap menelusuri setiap klaim hingga ke kotak atau cap waktunya — mudah dibaca dan tetap dapat diaudit.

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Audio, Teks, dan Penglihatan Bersama” gratis?

Ya — teks lengkap “Audio, Teks, dan Penglihatan Bersama” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Prompt Engineering, upgrade ke CoddyKit PRO. Kursus AI Prompt Engineering mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Audio, Teks, dan Penglihatan Bersama”?

Mengoordinasikan berbagai masukan. Kamu berlatih AI Prompt Engineering dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Prompt Engineering?

Tidak diperlukan pengalaman sebelumnya. AI Prompt Engineering di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.

Berapa lama pelajaran “Audio, Teks, dan Penglihatan Bersama” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Prompt Engineering ini?

Ya. Setiap pelajaran AI Prompt Engineering menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Menggabungkan Teks dan Gambar
  2. Pendasaran Lintas Modalitas
  3. Audio, Teks, dan Penglihatan Bersama
  4. Mengendalikan Keluaran Multimodal
← Kembali ke AI Prompt Engineering