LangChain / RAG / vektordatabaser · leksjon

Multimodal RAG med bilder og tabeller

Utvid RAG utover ren tekst for å hente og resonnere over bilder, diagrammer og strukturerte tabeller.

Leksjon 4 av 413 trinn

Multimodal RAG med bilder og tabeller er en gratis leksjon i LangChain / RAG / vektordatabaser på CoddyKit. Dette er leksjon 4 av 4. Du kan lese hele leksjonen gratis nedenfor – og deretter øve praktisk i nettleseren med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i LangChain / RAG / vektordatabaser, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i LangChain / RAG / vektordatabaser inneholder totalt 4 leksjoner.

Utover ren tekst

Virkelige dokumenter inneholder bilder, diagrammer og tabeller. Multimodal RAG indekserer og henter disse ikke-tekstlige elementene, slik at modellen kan svare på spørsmål som avhenger av dem.

Hva regnes som multimodalt?

Multimodale kilder omfatter skannede sider, diagrammer, skjermbilder, fotografier og tabeller i regnearkstil som er innebygd i PDF-er eller nettsider.

  • Bilder
  • Diagrammer og figurer
  • Tabeller

Strategi 1: Beskriv og embed

Bruk en synsmodell til å generere en tekstbeskrivelse av hvert bilde, og lag deretter en embedding av beskrivelsen med de vanlige tekst-embedding-ene. Innhentingen forblir tekstbasert.

caption = vision_model.describe(image)
store.add_texts([caption], metadatas=[{"image": image_id}])

Strategi 2: Multimodale embedding-er

Modeller som CLIP lager embedding-er av bilder og tekst i det samme vektorrommet, slik at en tekstspørring kan samsvare direkte med et bilde uten et trinn for bildetekst.

Håndtering av tabeller

Tabeller mister mening når de flates ut. Bevar strukturen ved å konvertere hver tabell til Markdown eller HTML før den deles opp i chunks, slik at rader og overskrifter fortsatt henger sammen.

table_md = "| Year | Revenue |\n|---|---|\n| 2024 | 10M |\n| 2025 | 12M |"
store.add_texts([table_md], metadatas=[{"type": "table"}])

Oppsummering av store tabeller

For brede eller lange tabeller bør De lagre både en oppsummering i naturlig språk, for innhenting, og råtabellen, for svaret, og knytte dem sammen med en id.

Ruting etter modalitet

Ved spørringstidspunktet må De finne ut hva spørsmålet trenger. En forespørsel om et diagram bør hente bildeelementer, mens et numerisk oppslag bør rette seg mot tabeller.

Sende bilder til LLM-en

Multimodale LLM-er kan ta imot bilder direkte i prompten. Når det relevante bildet er hentet inn, inkluderer De det sammen med spørsmålet for forankret resonnering.

messages = [{"role": "user", "content": [
    {"type": "text", "text": "What trend does this chart show?"},
    {"type": "image_url", "image_url": {"url": img_url}},
]}]

Referere til visuelle kilder

Registrer i metadata hvilket bilde eller hvilken tabell som produserte et svar, slik at De kan vise brukeren den nøyaktige figuren eller tabellen modellen baserte seg på.

Kostnad og ventetid

Synskall og bilde-embedding-er koster mer enn tekst. Bufre bildetekster, reduser bildestørrelsen, og bruk bare synsmodeller når spørringen faktisk trenger det.

Slik settes alt sammen

Trekk ut bilder og tabeller under innlasting, indekser dem via bildetekster eller multimodale embedding-er, rut spørringer etter modalitet, og send riktig element til en multimodal LLM.

Kort kontroll

Test forståelsen Deres av multimodal RAG.

Oppsummering

De har utvidet RAG til flere modaliteter:

  • Beskriv og embed eller multimodale embedding-er for bilder
  • Bevar tabell-strukturen som Markdown
  • Rut spørringer etter modalitet
  • Send bilder til en multimodal LLM og referer til visuelle kilder
Gratis å komme i gang

Lær deg LangChain / RAG / vektordatabaser med en AI-veileder – gratis

Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.

Kurs
12
Leksjoner
48

Ofte stilte spørsmål

Er leksjonen «Multimodal RAG med bilder og tabeller» gratis?

Ja – hele teksten i «Multimodal RAG med bilder og tabeller» er gratis å lese her på nettet. For å øve interaktivt med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt, og for å låse opp resten av LangChain / RAG / vektordatabaser-kurset, kan du oppgradere til CoddyKit PRO. Kurset i LangChain / RAG / vektordatabaser inneholder totalt 4 leksjoner.

Hva lærer jeg i «Multimodal RAG med bilder og tabeller»?

Utvid RAG utover ren tekst for å hente og resonnere over bilder, diagrammer og strukturerte tabeller. Du øver på LangChain / RAG / vektordatabaser med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.

Trenger jeg erfaring for å begynne med LangChain / RAG / vektordatabaser?

Ingen tidligere erfaring er nødvendig. LangChain / RAG / vektordatabaser på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 4 av 4.

Hvor lang tid tar leksjonen «Multimodal RAG med bilder og tabeller»?

De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.

Kan jeg skrive og kjøre kode i denne LangChain / RAG / vektordatabaser-leksjonen?

Ja. Alle LangChain / RAG / vektordatabaser-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.

Alle leksjonene i dette kurset

  1. RAG for kodegenerering og utviklerstøtte
  2. Bygging av RAG-systemer i sanntid
  3. Nye trender og forskning innen RAG
  4. Multimodal RAG med bilder og tabeller
← Tilbake til LangChain / RAG / vektordatabaser