Multimodal RAG med bilder og tabeller
Utvid RAG utover ren tekst for å hente og resonnere over bilder, diagrammer og strukturerte tabeller.
Multimodal RAG med bilder og tabeller er en gratis leksjon i LangChain / RAG / vektordatabaser på CoddyKit. Dette er leksjon 4 av 4. Du kan lese hele leksjonen gratis nedenfor – og deretter øve praktisk i nettleseren med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i LangChain / RAG / vektordatabaser, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i LangChain / RAG / vektordatabaser inneholder totalt 4 leksjoner.
Utover ren tekst
Virkelige dokumenter inneholder bilder, diagrammer og tabeller. Multimodal RAG indekserer og henter disse ikke-tekstlige elementene, slik at modellen kan svare på spørsmål som avhenger av dem.
Hva regnes som multimodalt?
Multimodale kilder omfatter skannede sider, diagrammer, skjermbilder, fotografier og tabeller i regnearkstil som er innebygd i PDF-er eller nettsider.
- Bilder
- Diagrammer og figurer
- Tabeller
Strategi 1: Beskriv og embed
Bruk en synsmodell til å generere en tekstbeskrivelse av hvert bilde, og lag deretter en embedding av beskrivelsen med de vanlige tekst-embedding-ene. Innhentingen forblir tekstbasert.
caption = vision_model.describe(image)
store.add_texts([caption], metadatas=[{"image": image_id}])Strategi 2: Multimodale embedding-er
Modeller som CLIP lager embedding-er av bilder og tekst i det samme vektorrommet, slik at en tekstspørring kan samsvare direkte med et bilde uten et trinn for bildetekst.
Håndtering av tabeller
Tabeller mister mening når de flates ut. Bevar strukturen ved å konvertere hver tabell til Markdown eller HTML før den deles opp i chunks, slik at rader og overskrifter fortsatt henger sammen.
table_md = "| Year | Revenue |\n|---|---|\n| 2024 | 10M |\n| 2025 | 12M |"
store.add_texts([table_md], metadatas=[{"type": "table"}])Oppsummering av store tabeller
For brede eller lange tabeller bør De lagre både en oppsummering i naturlig språk, for innhenting, og råtabellen, for svaret, og knytte dem sammen med en id.
Ruting etter modalitet
Ved spørringstidspunktet må De finne ut hva spørsmålet trenger. En forespørsel om et diagram bør hente bildeelementer, mens et numerisk oppslag bør rette seg mot tabeller.
Sende bilder til LLM-en
Multimodale LLM-er kan ta imot bilder direkte i prompten. Når det relevante bildet er hentet inn, inkluderer De det sammen med spørsmålet for forankret resonnering.
messages = [{"role": "user", "content": [
{"type": "text", "text": "What trend does this chart show?"},
{"type": "image_url", "image_url": {"url": img_url}},
]}]Referere til visuelle kilder
Registrer i metadata hvilket bilde eller hvilken tabell som produserte et svar, slik at De kan vise brukeren den nøyaktige figuren eller tabellen modellen baserte seg på.
Kostnad og ventetid
Synskall og bilde-embedding-er koster mer enn tekst. Bufre bildetekster, reduser bildestørrelsen, og bruk bare synsmodeller når spørringen faktisk trenger det.
Slik settes alt sammen
Trekk ut bilder og tabeller under innlasting, indekser dem via bildetekster eller multimodale embedding-er, rut spørringer etter modalitet, og send riktig element til en multimodal LLM.
Kort kontroll
Test forståelsen Deres av multimodal RAG.
Oppsummering
De har utvidet RAG til flere modaliteter:
- Beskriv og embed eller multimodale embedding-er for bilder
- Bevar tabell-strukturen som Markdown
- Rut spørringer etter modalitet
- Send bilder til en multimodal LLM og referer til visuelle kilder
Lær deg LangChain / RAG / vektordatabaser med en AI-veileder – gratis
Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.
- Kurs
- 12
- Leksjoner
- 48
Ofte stilte spørsmål
Er leksjonen «Multimodal RAG med bilder og tabeller» gratis?
Ja – hele teksten i «Multimodal RAG med bilder og tabeller» er gratis å lese her på nettet. For å øve interaktivt med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt, og for å låse opp resten av LangChain / RAG / vektordatabaser-kurset, kan du oppgradere til CoddyKit PRO. Kurset i LangChain / RAG / vektordatabaser inneholder totalt 4 leksjoner.
Hva lærer jeg i «Multimodal RAG med bilder og tabeller»?
Utvid RAG utover ren tekst for å hente og resonnere over bilder, diagrammer og strukturerte tabeller. Du øver på LangChain / RAG / vektordatabaser med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.
Trenger jeg erfaring for å begynne med LangChain / RAG / vektordatabaser?
Ingen tidligere erfaring er nødvendig. LangChain / RAG / vektordatabaser på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 4 av 4.
Hvor lang tid tar leksjonen «Multimodal RAG med bilder og tabeller»?
De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.
Kan jeg skrive og kjøre kode i denne LangChain / RAG / vektordatabaser-leksjonen?
Ja. Alle LangChain / RAG / vektordatabaser-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.
Alle leksjonene i dette kurset
- RAG for kodegenerering og utviklerstøtte
- Bygging av RAG-systemer i sanntid
- Nye trender og forskning innen RAG
- Multimodal RAG med bilder og tabeller