Kejuruteraan Arahan AI · Pelajaran

Menggabungkan Teks dan Imej

Arahan multimodal yang disatukan.

Pelajaran 1 daripada 413 langkah

Menggabungkan Teks dan Imej ialah pelajaran Kejuruteraan Arahan AI percuma di CoddyKit. Ini ialah pelajaran 1 daripada 4. Sebanyak 3 pelajaran dalam laluan pembelajaran ini boleh dibaca sepenuhnya secara percuma — selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan praktikal dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Kejuruteraan Arahan AI, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Kejuruteraan Arahan AI merangkumi sejumlah 4 pelajaran.

Gesaan Multimodal Bersepadu

Gesaan multimodal bukanlah teks bersama imej yang dilampirkan. Ia ialah urutan selang-seli tunggal yang menempatkan token imej dan token teks dalam konteks yang sama, lalu kedua-duanya saling memberi perhatian. Model tidak 'melihat gambar kemudian membaca teks' — model memproses aliran token yang bercantum.

  • Petak imej dipetakan ke ruang pembenaman yang sama dengan token teks.
  • Susunan penting: soalan yang diletakkan sebelum imej mencetuskan corak perhatian yang berbeza daripada soalan yang diletakkan selepas imej.
  • Anda sedang mengarang satu gesaan dengan dua bentuk permukaan, bukan dua gesaan.

Susunan Selang-seli dan Penambatan

Tempat anda meletakkan imej berbanding arahan mengubah tingkah laku. Meletakkan arahan selepas imej membolehkan model menetapkan soalan berdasarkan perkara yang telah dikodkannya; meletakkannya sebelum imej menjadikan imej sebagai bukti untuk tugas yang telah dinyatakan terlebih dahulu.

Bagi gesaan berbilang imej, labelkan setiap imej secara sebaris supaya teks seterusnya boleh merujuknya tanpa kekeliruan ([Image 1], [Image 2]).

messages = [
  {'role': 'user', 'content': [
    {'type': 'text', 'text': 'You will see two product photos.'},
    {'type': 'text', 'text': 'Image 1:'},
    {'type': 'image', 'source': img_a},
    {'type': 'text', 'text': 'Image 2:'},
    {'type': 'image', 'source': img_b},
    {'type': 'text', 'text': 'Which has better lighting? Cite the image label.'}
  ]}
]

Membingkai Tugas Sebelum Pengekodan

Pengekod penglihatan bersifat hilang maklumat: butiran yang tidak berkaitan dengan tugas tersirat boleh dibuang semasa pengumpulan. Jika anda menyatakan tugas sebelum imej, anda mendorong model untuk memberi perhatian kepada kawasan yang penting.

  • Permintaan kapsyen umum menghasilkan ciri umum.
  • Soalan khusus ('kira perintang pada papan') memfokuskan bajet perwakilan pada subkawasan yang berkaitan.

Utamakan kekhususan dari awal apabila butiran halus diperlukan.

Bajet Resolusi dan Penjubinan

Kebanyakan model penglihatan membahagikan imej beresolusi tinggi kepada tampalan bersaiz tetap, yang setiap satunya menggunakan token. Imej 2000x2000 mungkin dibahagikan kepada banyak jubin, yang setiap satunya disampel turun. Bajet token ialah kekangan senyap dalam pengarahan pelbagai mod.

  • Lakukan crop pada kawasan yang diminati sebelum menghantar imej — jangan bergantung pada model untuk mengezum.
  • Untuk dokumen yang padat, hantar crop halaman dan bukannya satu imej halaman penuh.
  • Ketahui bilangan maksimum jubin yang ditetapkan oleh penyedia anda; selepas had itu, teks halus menjadi tidak boleh dibaca.
def estimate_image_tokens(w, h, tile=512, per_tile=256):
    import math
    tiles = math.ceil(w / tile) * math.ceil(h / tile)
    return tiles * per_tile + per_tile  # + thumbnail

Teks sebagai Skema Berstruktur untuk Penglihatan

Gabungkan imej dengan skema keluaran yang jelas dalam saluran teks. Imej membekalkan kandungan; teks membekalkan kontrak. Kaedah ini jauh lebih boleh dipercayai berbanding penerangan bentuk bebas.

Minta JSON dengan kunci berdasarkan entiti yang anda jangka akan dilihat, dan arahkan model untuk mengeluarkan null bagi medan yang tidak kelihatan — ini menyekat butiran rekaan.

instruction = (
  'Extract from the receipt image. Return JSON: '
  '{"merchant": str|null, "total": number|null, '
  '"date": str|null, "line_items": [{"name": str, "price": number}]}. '
  'Use null when a field is not legible. Do not invent values.'
)

Menentukan Rujukan Deiktik

Rujukan deiktik ('ini', 'yang di sebelah kiri', 'kotak yang diserlahkan') mengikat teks pada kawasan imej. Apabila anda boleh membuat anotasi awal pada imej (lukis kotak, tambah anak panah), rujukan teks menjadi jauh lebih kukuh berbanding bahasa ruang semata-mata.

  • Perkataan ruang ('kanan atas') mudah menghasilkan kesilapan apabila imej diputar atau dicrop.
  • Penanda bernombor yang ditindih bersama 'objek #3' tidak menimbulkan kekeliruan.
  • Prapemprosesan imej untuk menambah penanda ialah langkah kejuruteraan arahan yang sah.

Pembelajaran dengan Beberapa Contoh dan Mod Campuran

Anda boleh membekalkan contoh imej-ke-teks untuk menetapkan format dan gaya penaakulan. Setiap contoh ialah pasangan (imej, jawapan ideal) yang diselang-seli. Model membuat inferens pemetaan daripada demonstrasi tersebut.

Pastikan imej contoh mewakili taburan sebenar — contoh daripada domain yang berbeza mengajar pemilihan ciri yang salah.

shots = [
  ('image', chart_a), ('text', 'Trend: upward. Peak: Q3. Anomaly: none.'),
  ('image', chart_b), ('text', 'Trend: flat. Peak: Q1. Anomaly: Q4 dip.'),
  ('image', target_chart), ('text', 'Trend:')  # model completes
]

Menyandarkan Dakwaan pada Piksel

Untuk pengekstrakan yang berisiko tinggi, wajibkan model menyatakan di mana dalam imej setiap dakwaan berasal. Kotak sempadan anggaran atau teks pada imej yang dipetik bertindak sebagai bukti yang boleh disahkan dan mengurangkan rekaan yakin secara mendadak.

  • 'Bagi setiap nilai, petik teks label tepat yang anda baca.'
  • 'Berikan kotak ternormal anggaran [x0,y0,x1,y1] bagi setiap medan.'

Penyandaran menukar jawapan legap menjadi jawapan yang boleh diaudit.

Cara Kegagalan yang Perlu Dicegah

Model pelbagai mod gagal dengan cara yang lazim:

  • Penyimpangan OCR pada fon kecil atau bergaya — digit seperti 1/7 dan 0/O mudah dikelirukan.
  • Kegagalan mengira apabila terdapat lebih kurang 6 objek yang serupa.
  • Bias kapsyen: menerangkan adegan lazim dan bukannya adegan sebenar.
  • Pengambilalihan saluran teks: dakwaan teks yang salah tetapi yakin boleh menindas bukti penglihatan yang betul.

Kurangkan masalah ini dengan meminta model membuat kesimpulan daripada imej dahulu, kemudian menyelaraskannya dengan sebarang dakwaan teks.

Arahan Penyelarasan

Apabila konteks teks dan imej bercanggah, anda mesti menentukan keutamaan dengan jelas — model tidak mempunyai dasar lalai yang boleh dipercayai. Nyatakannya: 'Jika imej bercanggah dengan metadata yang diberikan, percayai imej dan tandakan percanggahan tersebut.'

Ayat tunggal ini menukar kesilapan senyap menjadi konflik jelas yang boleh dikesan dan disalurkan oleh saluran paip hiliran anda untuk semakan.

policy = (
  'You are given metadata AND a photo. '
  'When they disagree, prefer the photo as ground truth. '
  'Emit {"value": ..., "conflict": bool, "note": str}.'
)

Mereka Bentuk Saluran Paip Penggabungan

Pengarahan pelbagai mod dalam pengeluaran ialah saluran paip, bukan satu panggilan:

  • Praproses: crop, buat anotasi dan kecilkan saiz mengikut bajet.
  • Gabungkan: selang-selikan dengan arahan yang mengutamakan tugas serta skema keluaran.
  • Sandarkan: wajibkan bukti bagi setiap dakwaan.
  • Selaraskan: nyatakan keutamaan antara mod.
  • Sahkan: huraikan JSON, semak nilai kosong dan penanda konflik.

Setiap peringkat mengecilkan ruang kegagalan yang tidak dapat diatasi oleh pengarahan semata-mata.

Semakan Pantas

Anda mesti mengekstrak tulisan halus daripada imbasan kontrak beresolusi tinggi dan memerlukan nombor yang boleh dipercayai.

Imbas Kembali: Menggabungkan Teks dan Imej

Arahan pelbagai mod yang disatukan ialah satu aliran token yang diselang-seli. Langkah utama: pembingkaian yang mengutamakan tugas untuk mengarahkan pengekod penglihatan, kesedaran terhadap resolusi dan penjubinan melalui crop, skema keluaran yang jelas dengan medan yang boleh bernilai kosong, penyandaran pada piksel bagi setiap dakwaan, dan keutamaan mod yang dinyatakan untuk konflik. Anggaplahnya sebagai saluran paip — praproses, gabungkan, sandarkan, selaraskan, sahkan — supaya bahagian pengarahan penglihatan yang rapuh menjadi terkawal.

Percuma untuk bermula

Pelajari Kejuruteraan Arahan AI dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
53
Pelajaran
199

Soalan Lazim

Adakah pelajaran “Menggabungkan Teks dan Imej” percuma?

Ya — sebanyak 3 pelajaran dalam laluan pembelajaran Kejuruteraan Arahan AI, termasuk “Menggabungkan Teks dan Imej”, boleh dibaca sepenuhnya secara percuma di web ini. Selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan interaktif dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Kursus Kejuruteraan Arahan AI merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Menggabungkan Teks dan Imej”?

Arahan multimodal yang disatukan. Anda berlatih Kejuruteraan Arahan AI menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan Kejuruteraan Arahan AI?

Tiada pengalaman terdahulu diperlukan. Pembelajaran Kejuruteraan Arahan AI di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 1 daripada 4.

Berapa lamakah pelajaran “Menggabungkan Teks dan Imej” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran Kejuruteraan Arahan AI ini?

Ya. Setiap pelajaran Kejuruteraan Arahan AI menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Menggabungkan Teks dan Imej
  2. Mendasarkan Jawapan Merentas Modaliti
  3. Audio, Teks dan Penglihatan Bersama
  4. Kawalan Output Multimodal
← Kembali ke Kejuruteraan Arahan AI