Menggabungkan Teks dan Gambar
Prompt multimodal terpadu.
Menggabungkan Teks dan Gambar adalah pelajaran AI Prompt Engineering gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Prompt Engineering, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Prompt Engineering mencakup 4 pelajaran total.
Prompt Multimodal Terpadu
Prompt multimodal bukan sekadar teks ditambah gambar terlampir. Ini adalah urutan tunggal yang diselang-seling, tempat token gambar dan token teks menempati konteks yang sama dan saling memperhatikan. Model tidak 'melihat gambar lalu membaca teks'—model memproses aliran token yang menyatu.
- Potongan gambar diproyeksikan ke ruang penyematan yang sama dengan token teks.
- Urutan penting: pertanyaan yang ditempatkan sebelum gambar memicu perhatian yang berbeda dari pertanyaan yang ditempatkan setelah gambar.
- Anda sedang menulis satu prompt dengan dua bentuk permukaan, bukan dua prompt.
Urutan Penyisipan dan Penjangkaran
Posisi gambar relatif terhadap instruksi mengubah perilaku. Menempatkan instruksi setelah gambar memungkinkan model mengondisikan pertanyaan berdasarkan apa yang telah dikodekannya; menempatkannya sebelum gambar menjadikan gambar sebagai bukti untuk tugas yang telah dinyatakan sebelumnya.
Untuk prompt dengan banyak gambar, beri label pada setiap gambar secara sebaris agar teks berikutnya dapat merujuknya tanpa ambiguitas ([Image 1], [Image 2]).
messages = [
{'role': 'user', 'content': [
{'type': 'text', 'text': 'You will see two product photos.'},
{'type': 'text', 'text': 'Image 1:'},
{'type': 'image', 'source': img_a},
{'type': 'text', 'text': 'Image 2:'},
{'type': 'image', 'source': img_b},
{'type': 'text', 'text': 'Which has better lighting? Cite the image label.'}
]}
]Perumusan Tugas Sebelum Pengodean
Pengode visi bersifat lossy: detail yang tidak relevan dengan tugas implisit dapat dibuang saat pooling. Jika Anda menyatakan tugas sebelum gambar, Anda mengarahkan model untuk memperhatikan wilayah yang penting.
- Permintaan keterangan umum menghasilkan fitur yang umum.
- Pertanyaan spesifik ('hitung resistor pada papan') memusatkan anggaran representasi pada subwilayah yang relevan.
Letakkan spesifikasi di awal jika detail halus diperlukan.
Anggaran Resolusi dan Pemotongan Ubin
Sebagian besar model visi membagi gambar beresolusi tinggi menjadi petak berukuran tetap, yang masing-masing memerlukan token. Gambar berukuran 2000x2000 dapat dibagi menjadi banyak petak, yang masing-masing diperkecil. Anggaran token adalah batasan tersembunyi dalam pemberian prompt multimodal.
- Potong ke wilayah yang diminati sebelum mengirimnya — jangan mengandalkan model untuk memperbesar tampilan.
- Untuk dokumen padat, kirim potongan halaman, bukan satu gambar halaman penuh.
- Ketahui jumlah petak maksimum penyedia Anda; setelah batas itu terlampaui, teks kecil menjadi tidak terbaca.
def estimate_image_tokens(w, h, tile=512, per_tile=256):
import math
tiles = math.ceil(w / tile) * math.ceil(h / tile)
return tiles * per_tile + per_tile # + thumbnailTeks sebagai Skema Terstruktur untuk Visi
Gabungkan gambar dengan skema keluaran eksplisit di kanal teks. Gambar menyediakan konten; teks menyediakan kontrak. Ini jauh lebih andal daripada deskripsi bebas.
Minta JSON dengan kunci berdasarkan entitas yang Anda perkirakan akan terlihat, dan instruksikan model untuk menghasilkan null pada bidang yang tidak terlihat — hal ini menekan detail hasil halusinasi.
instruction = (
'Extract from the receipt image. Return JSON: '
'{"merchant": str|null, "total": number|null, '
'"date": str|null, "line_items": [{"name": str, "price": number}]}. '
'Use null when a field is not legible. Do not invent values.'
)Memperjelas dengan Deiksis
Rujukan deiktik ('ini', 'yang di sebelah kiri', 'kotak yang disorot') mengikat teks pada wilayah gambar. Jika Anda dapat memberi anotasi awal pada gambar (menggambar kotak, menambahkan panah), rujukan teks menjadi jauh lebih kuat daripada hanya menggunakan bahasa spasial.
- Kata-kata spasial ('kanan atas') rentan terhadap kesalahan saat gambar diputar atau dipotong.
- Penanda bernomor yang ditumpangkan, ditambah 'objek #3', tidak ambigu.
- Prapemrosesan gambar untuk menambahkan penanda merupakan langkah rekayasa prompt yang sah.
Few-Shot dengan Modalitas Campuran
Anda dapat menyediakan contoh gambar-ke-teks untuk mengunci format dan gaya penalaran. Setiap contoh adalah pasangan (gambar, jawaban ideal) yang disisipkan secara berselang-seling. Model menyimpulkan pemetaan dari demonstrasi tersebut.
Pastikan gambar contoh mewakili distribusi nyata — contoh dari ranah berbeda mengajarkan pemilihan fitur yang keliru.
shots = [
('image', chart_a), ('text', 'Trend: upward. Peak: Q3. Anomaly: none.'),
('image', chart_b), ('text', 'Trend: flat. Peak: Q1. Anomaly: Q4 dip.'),
('image', target_chart), ('text', 'Trend:') # model completes
]Menautkan Klaim ke Piksel
Untuk ekstraksi berisiko tinggi, minta model menyebutkan di mana dalam gambar setiap klaim berasal. Kotak pembatas perkiraan atau teks pada gambar yang dikutip berfungsi sebagai bukti yang dapat diverifikasi dan secara drastis mengurangi fabrikasi yang disampaikan dengan yakin.
- 'Untuk setiap nilai, kutip teks label persis seperti yang Anda baca.'
- 'Berikan kotak ternormalisasi perkiraan [x0,y0,x1,y1] untuk setiap bidang.'
Penautan bukti mengubah jawaban yang tidak transparan menjadi jawaban yang dapat diaudit.
Mode Kegagalan yang Perlu Diwaspadai
Model multimodal gagal dengan cara-cara yang khas:
- Drift OCR pada fon kecil atau bergaya — angka seperti 1/7 dan 0/O dapat tertukar.
- Keruntuhan penghitungan ketika jumlah objek serupa melebihi sekitar 6.
- Bias keterangan: mendeskripsikan adegan yang umum, bukan adegan yang sebenarnya.
- Penimpaan kanal teks: klaim teks yang salah tetapi disampaikan dengan yakin dapat menekan bukti visual yang benar.
Atasi dengan meminta model menarik kesimpulan dari gambar terlebih dahulu, lalu mencocokkannya dengan pernyataan teks apa pun.
Prompt Rekonsiliasi
Ketika konteks teks dan gambar bertentangan, Anda harus menentukan prioritas secara eksplisit — model tidak memiliki kebijakan bawaan yang dapat Anda percayai. Nyatakan: 'Jika gambar bertentangan dengan metadata yang diberikan, percayai gambar dan tandai perbedaannya.'
Satu kalimat ini mengubah kesalahan diam-diam menjadi konflik eksplisit yang terlihat, sehingga alur kerja lanjutan Anda dapat mengarahkannya untuk ditinjau.
policy = (
'You are given metadata AND a photo. '
'When they disagree, prefer the photo as ground truth. '
'Emit {"value": ..., "conflict": bool, "note": str}.'
)Merancang Alur Kerja Fusi
Pemberian prompt multimodal di lingkungan produksi adalah alur kerja, bukan satu panggilan:
- Praproses: potong, beri anotasi, perkecil sesuai anggaran.
- Fusikan: selang-selingkan dengan instruksi yang mendahulukan tugas dan skema keluaran.
- Tautkan bukti: minta bukti untuk setiap klaim.
- Rekonsiliasikan: nyatakan prioritas antar modalitas.
- Validasi: uraikan JSON, periksa nilai null dan penanda konflik.
Setiap tahap mempersempit permukaan kegagalan yang tidak dapat diatasi oleh pemberian prompt saja.
Pemeriksaan Singkat
Anda harus mengekstrak tulisan kecil dari hasil pemindaian kontrak beresolusi tinggi dan memerlukan angka yang andal.
Ringkasan: Memadukan Teks dan Gambar
Prompt multimodal terpadu adalah satu aliran token yang disisipkan secara berselang-seling. Langkah utama: perumusan yang mendahulukan tugas untuk mengarahkan pengode visi, kesadaran terhadap resolusi/pemotongan ubin melalui pemotongan gambar, skema keluaran eksplisit dengan bidang yang boleh bernilai null, penautan ke piksel untuk setiap klaim, dan prioritas modalitas yang dinyatakan saat terjadi konflik. Perlakukan semuanya sebagai alur kerja — praproses, fusikan, tautkan bukti, rekonsiliasikan, validasi — agar bagian-bagian pemberian prompt visi yang rapuh menjadi terkendali.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Menggabungkan Teks dan Gambar” gratis?
Ya — teks lengkap “Menggabungkan Teks dan Gambar” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Prompt Engineering, upgrade ke CoddyKit PRO. Kursus AI Prompt Engineering mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Menggabungkan Teks dan Gambar”?
Prompt multimodal terpadu. Kamu berlatih AI Prompt Engineering dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Prompt Engineering?
Tidak diperlukan pengalaman sebelumnya. AI Prompt Engineering di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.
Berapa lama pelajaran “Menggabungkan Teks dan Gambar” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Prompt Engineering ini?
Ya. Setiap pelajaran AI Prompt Engineering menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Menggabungkan Teks dan Gambar
- Pendasaran Lintas Modalitas
- Audio, Teks, dan Penglihatan Bersama
- Mengendalikan Keluaran Multimodal