Multimodaalinen RAG kuvilla ja taulukoilla
Laajentakaa RAG pelkän tekstin ulkopuolelle hakemaan ja tulkitsemaan kuvia, kaavioita ja rakenteisia taulukoita.
Multimodaalinen RAG kuvilla ja taulukoilla on ilmainen LangChain / RAG / vektoritietokannat-oppitunti CoddyKitissä. Tämä on oppitunti 4/4. Voit lukea koko oppitunnin alta ilmaiseksi ja harjoitella sen jälkeen käytännössä selaimessa sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla. Oppitunti kuuluu LangChain / RAG / vektoritietokannat-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. LangChain / RAG / vektoritietokannat-kurssilla on yhteensä 4 oppituntia.
Pelkkää tekstiä pidemmälle
Oikeat dokumentit sisältävät kuvia, kaavioita ja taulukoita. Multimodaalinen RAG indeksoi ja hakee näitä tekstittömiä elementtejä, jotta malli voi vastata niistä riippuviin kysymyksiin.
Mikä lasketaan multimodaaliseksi
Multimodaalisia lähteitä ovat skannatut sivut, kaaviot, näyttökuvat, valokuvat ja PDF-tiedostoihin tai verkkosivuille upotetut taulukkolaskentatyyliset taulukot.
- Kuvat
- Kaaviot ja kuvat
- Taulukot
Strategia 1: Kuvaile ja upota
Luo näkömallin avulla jokaisesta kuvasta tekstikuvaus ja muodosta sitten kuvauksesta embedding tavallisilla tekstien embeddingeilläsi. Haku pysyy tekstipohjaisena.
caption = vision_model.describe(image)
store.add_texts([caption], metadatas=[{"image": image_id}])Strategia 2: Multimodaaliset embeddingit
CLIP:n kaltaiset mallit upottavat kuvat ja tekstin samaan vektoriavaruuteen, joten tekstikysely voi osua suoraan kuvaan ilman kuvatekstivaihetta.
Taulukoiden käsittely
Taulukot menettävät merkityksensä, kun ne litistetään. Säilytä rakenne muuntamalla kukin taulukko Markdown- tai HTML-muotoon ennen osiin jakamista, jotta rivit ja otsikot pysyvät yhteydessä.
table_md = "| Year | Revenue |\n|---|---|\n| 2024 | 10M |\n| 2025 | 12M |"
store.add_texts([table_md], metadatas=[{"type": "table"}])Suurten taulukoiden tiivistäminen
Leveistä tai pitkistä taulukoista kannattaa tallentaa sekä luonnollisen kielen tiivistelmä hakua varten että raakataulukko vastausta varten ja yhdistää ne tunnisteella.
Reititys modaliteetin mukaan
Tunnista kyselyhetkellä, mitä kysymys tarvitsee. Kaaviota koskevan pyynnön tulisi hakea kuvaelementtejä, kun taas numeerisen tiedon haun tulisi kohdistua taulukoihin.
Kuvien välittäminen LLM:lle
Multimodaaliset LLM:t hyväksyvät kuvia suoraan kehotteessa. Kun olet hakenut asiaankuuluvan kuvan, lisää se kysymyksen rinnalle perusteltua päättelyä varten.
messages = [{"role": "user", "content": [
{"type": "text", "text": "What trend does this chart show?"},
{"type": "image_url", "image_url": {"url": img_url}},
]}]Visuaalisten lähteiden viittaaminen
Seuraa metatiedoissa, mikä kuva tai taulukko tuotti vastauksen, jotta voit näyttää käyttäjälle täsmälleen sen kaavion tai taulukon, johon malli tukeutui.
Kustannukset ja viive
Näkömallikutsut ja kuvaembeddingit maksavat enemmän kuin tekstin käsittely. Tallenna kuvatekstit välimuistiin, pienennä kuvia ja käytä näkömallia vain, kun kysely todella tarvitsee sitä.
Kokonaisuuden kokoaminen
Poimi kuvat ja taulukot latauksen aikana, indeksoi ne kuvatekstien tai multimodaalisten embeddingien avulla, reititä kyselyt modaliteetin mukaan ja syötä oikea elementti multimodaaliselle LLM:lle.
Pikatarkistus
Testaa, miten hyvin ymmärrät multimodaalista RAG-järjestelmää.
Kertaus
Laajensit RAG:n useisiin modaliteetteihin:
- Kuvaile ja upota tai käytä multimodaalisia embeddingejä kuville
- Säilytä taulukoiden rakenne Markdown-muodossa
- Reititä kyselyt modaliteetin mukaan
- Syötä kuvat multimodaaliselle LLM:lle ja viittaa visuaalisiin lähteisiin
Opi LangChain / RAG / vektoritietokannat tekoälytuutorin avulla — ilmaiseksi
Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.
- Kurssit
- 12
- Oppitunnit
- 48
Usein kysytyt kysymykset
Onko oppitunti ”Multimodaalinen RAG kuvilla ja taulukoilla” ilmainen?
Kyllä – oppitunnin ”Multimodaalinen RAG kuvilla ja taulukoilla” koko tekstin voi lukea täällä verkossa ilmaiseksi. Jos haluat harjoitella interaktiivisesti sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla sekä avata koko LangChain / RAG / vektoritietokannat-kurssin, päivitä CoddyKit PROhon. LangChain / RAG / vektoritietokannat-kurssilla on yhteensä 4 oppituntia.
Mitä opin oppitunnilla ”Multimodaalinen RAG kuvilla ja taulukoilla”?
Laajentakaa RAG pelkän tekstin ulkopuolelle hakemaan ja tulkitsemaan kuvia, kaavioita ja rakenteisia taulukoita. Harjoittelet LangChain / RAG / vektoritietokannat-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.
Tarvitsenko kokemusta aloittaakseni LangChain / RAG / vektoritietokannat-opiskelun?
Aiempi kokemus ei ole tarpeen. CoddyKitin LangChain / RAG / vektoritietokannat-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 4/4.
Kuinka kauan ”Multimodaalinen RAG kuvilla ja taulukoilla”-oppitunnin suorittaminen kestää?
Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.
Voinko kirjoittaa ja suorittaa koodia tällä LangChain / RAG / vektoritietokannat-oppitunnilla?
Kyllä. Jokainen LangChain / RAG / vektoritietokannat-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.
Kaikki tämän kurssin oppitunnit
- RAG koodin generointiin ja avustamiseen
- Reaaliaikaisten RAG-järjestelmien rakentaminen
- RAG:n uudet suuntaukset ja tutkimus
- Multimodaalinen RAG kuvilla ja taulukoilla