RAG Multimodal dengan Imej dan Jadual
Luaskan RAG melangkaui teks biasa untuk mendapatkan semula dan menaakul tentang imej, carta dan jadual berstruktur.
RAG Multimodal dengan Imej dan Jadual ialah pelajaran LangChain / RAG / Pangkalan Data Vektor percuma di CoddyKit. Ini ialah pelajaran 4 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran LangChain / RAG / Pangkalan Data Vektor, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus LangChain / RAG / Pangkalan Data Vektor merangkumi sejumlah 4 pelajaran.
Melangkaui Teks Biasa
Dokumen sebenar mengandungi imej, carta dan jadual. RAG multimodal mengindeks serta mendapatkan semula unsur bukan teks ini supaya model dapat menjawab soalan yang bergantung padanya.
Apakah yang Dikira sebagai Multimodal
Sumber multimodal termasuk halaman yang diimbas, rajah, tangkapan skrin, foto dan jadual gaya hamparan yang dibenamkan dalam PDF atau halaman web.
- Imej
- Carta dan rajah
- Jadual
Strategi 1: Huraikan Kemudian Benamkan
Gunakan model penglihatan untuk menjana perihalan teks bagi setiap imej, kemudian benamkan perihalan itu dengan pembenaman teks biasa anda. Pengambilan semula kekal berasaskan teks.
caption = vision_model.describe(image)
store.add_texts([caption], metadatas=[{"image": image_id}])Strategi 2: Pembenaman Multimodal
Model seperti CLIP membenamkan imej dan teks ke dalam ruang vektor yang sama, jadi pertanyaan teks boleh dipadankan terus dengan imej tanpa langkah kapsyen.
Mengendalikan Jadual
Jadual kehilangan makna apabila diratakan. Kekalkan strukturnya dengan menukar setiap jadual kepada Markdown atau HTML sebelum membahagikannya, supaya baris dan pengepala kekal berkaitan.
table_md = "| Year | Revenue |\n|---|---|\n| 2024 | 10M |\n| 2025 | 12M |"
store.add_texts([table_md], metadatas=[{"type": "table"}])Meringkaskan Jadual Besar
Untuk jadual yang lebar atau panjang, simpan kedua-dua ringkasan bahasa semula jadi (untuk pengambilan semula) dan jadual mentah (untuk jawapan), serta hubungkan kedua-duanya melalui id.
Penghalaan mengikut Modaliti
Pada masa pertanyaan, tentukan perkara yang diperlukan oleh soalan. Permintaan tentang carta hendaklah mendapatkan unsur imej; carian nilai berangka hendaklah menyasarkan jadual.
Menghantar Imej kepada LLM
LLM multimodal menerima imej secara terus dalam gesaan. Selepas mendapatkan imej yang berkaitan, sertakannya bersama soalan untuk penaakulan berasaskan sumber.
messages = [{"role": "user", "content": [
{"type": "text", "text": "What trend does this chart show?"},
{"type": "image_url", "image_url": {"url": img_url}},
]}]Memetik Sumber Visual
Jejaki imej atau jadual yang menghasilkan jawapan dalam metadata supaya anda boleh menunjukkan kepada pengguna rajah atau jadual tepat yang menjadi sandaran model.
Kos dan Kependaman
Panggilan penglihatan dan pembenaman imej lebih mahal berbanding teks. Cache kapsyen, kecilkan saiz imej dan gunakan penglihatan hanya apabila pertanyaan benar-benar memerlukannya.
Menggabungkan Kesemuanya
Ekstrak imej dan jadual semasa pemuatan, indekskannya melalui kapsyen atau pembenaman multimodal, halakan pertanyaan mengikut modaliti dan berikan unsur yang betul kepada LLM multimodal.
Semakan Pantas
Uji pemahaman anda tentang RAG multimodal.
Ringkasan
Anda telah meluaskan RAG kepada pelbagai modaliti:
- Huraikan-kemudian-benamkan atau pembenaman multimodal untuk imej
- Kekalkan struktur jadual sebagai Markdown
- Halakan pertanyaan mengikut modaliti
- Berikan imej kepada LLM multimodal dan petik sumber visual
Pelajari LangChain / RAG / Pangkalan Data Vektor dengan tutor kecerdasan buatan — percuma
Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.
- Kursus
- 12
- Pelajaran
- 48
Soalan Lazim
Adakah pelajaran “RAG Multimodal dengan Imej dan Jadual” percuma?
Ya — teks penuh “RAG Multimodal dengan Imej dan Jadual” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus LangChain / RAG / Pangkalan Data Vektor, tingkat taraf kepada CoddyKit PRO. Kursus LangChain / RAG / Pangkalan Data Vektor merangkumi sejumlah 4 pelajaran.
Apakah yang akan saya pelajari dalam “RAG Multimodal dengan Imej dan Jadual”?
Luaskan RAG melangkaui teks biasa untuk mendapatkan semula dan menaakul tentang imej, carta dan jadual berstruktur. Anda berlatih LangChain / RAG / Pangkalan Data Vektor menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.
Adakah saya memerlukan pengalaman untuk memulakan LangChain / RAG / Pangkalan Data Vektor?
Tiada pengalaman terdahulu diperlukan. Pembelajaran LangChain / RAG / Pangkalan Data Vektor di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 4 daripada 4.
Berapa lamakah pelajaran “RAG Multimodal dengan Imej dan Jadual” diambil?
Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.
Bolehkah saya menulis dan menjalankan kod dalam pelajaran LangChain / RAG / Pangkalan Data Vektor ini?
Ya. Setiap pelajaran LangChain / RAG / Pangkalan Data Vektor menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.
Semua pelajaran dalam kursus ini
- RAG untuk Penjanaan dan Bantuan Kod
- Membina Sistem RAG Masa Nyata
- Trend dan Penyelidikan Terkini dalam RAG
- RAG Multimodal dengan Imej dan Jadual