LangChain / RAG / vektordatabaser · Lektion

Multimodal RAG med billeder og tabeller

Udvid RAG ud over ren tekst, så De kan hente og ræsonnere over billeder, diagrammer og strukturerede tabeller.

Lektion 4 af 413 trin

Multimodal RAG med billeder og tabeller er en gratis LangChain / RAG / vektordatabaser-lektion på CoddyKit. Dette er lektion 4 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i LangChain / RAG / vektordatabaser, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. LangChain / RAG / vektordatabaser-kurset indeholder 4 lektioner i alt.

Ud over almindelig tekst

Virkelige dokumenter indeholder billeder, diagrammer og tabeller. Multimodal RAG indekserer og henter disse ikke-tekstlige elementer, så modellen kan besvare spørgsmål, der afhænger af dem.

Hvad tæller som multimodalt?

Multimodale kilder omfatter scannede sider, diagrammer, skærmbilleder, fotos og tabeller i regnearksstil, der er indlejret i PDF-filer eller websider.

  • Billeder
  • Diagrammer og figurer
  • Tabeller

Strategi 1: Beskriv, og lav derefter embeddings

Brug en synsmodel til at generere en tekstbeskrivelse af hvert billede, og lav derefter en embedding af beskrivelsen med dine normale tekstembeddings. Hentningen forbliver tekstbaseret.

caption = vision_model.describe(image)
store.add_texts([caption], metadatas=[{"image": image_id}])

Strategi 2: Multimodale embeddings

Modeller som CLIP laver embeddings af billeder og tekst i det samme vektorrum, så en tekstforespørgsel kan matche et billede direkte uden et trin med billedtekst.

Håndtering af tabeller

Tabeller mister betydning, når de flades ud. Bevar strukturen ved at konvertere hver tabel til Markdown eller HTML før opdeling i bidder, så rækker og overskrifter fortsat hænger sammen.

table_md = "| Year | Revenue |\n|---|---|\n| 2024 | 10M |\n| 2025 | 12M |"
store.add_texts([table_md], metadatas=[{"type": "table"}])

Opsummering af store tabeller

For brede eller lange tabeller skal du gemme både en opsummering på naturligt sprog (til hentning) og den rå tabel (til svaret) og knytte dem sammen via id.

Routing efter modalitet

Find ud af, hvad spørgsmålet har brug for, på forespørgselstidspunktet. En forespørgsel om et diagram bør hente billedelementer, mens et numerisk opslag bør målrettes tabeller.

Sådan sender du billeder til LLM'en

Multimodale LLM'er accepterer billeder direkte i prompten. Når du har hentet det relevante billede, skal du inkludere det sammen med spørgsmålet, så ræsonnementet forankres.

messages = [{"role": "user", "content": [
    {"type": "text", "text": "What trend does this chart show?"},
    {"type": "image_url", "image_url": {"url": img_url}},
]}]

Kildehenvisninger til visuelle kilder

Registrer i metadata, hvilket billede eller hvilken tabel der frembragte et svar, så du kan vise brugeren den præcise figur eller tabel, modellen baserede sig på.

Omkostninger og svartid

Synskald og billedembeddings koster mere end tekst. Gem billedtekster i en cache, nedskaler billeder, og brug kun synsmodellen, når forespørgslen faktisk kræver det.

Sådan samler du det hele

Udtræk billeder og tabeller under indlæsningen, indekser dem via billedtekster eller multimodale embeddings, rout forespørgsler efter modalitet, og send det rigtige element til en multimodal LLM.

Hurtigt tjek

Test din forståelse af multimodal RAG.

Opsummering

Du har udvidet RAG til flere modaliteter:

  • Beskriv og lav derefter embeddings eller multimodale embeddings til billeder
  • Bevar tabellers struktur som Markdown
  • Rout forespørgsler efter modalitet
  • Send billeder til en multimodal LLM, og angiv visuelle kilder
Gratis at komme i gang

Lær LangChain / RAG / vektordatabaser med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
12
Lektioner
48

Ofte stillede spørgsmål

Er lektionen “Multimodal RAG med billeder og tabeller” gratis?

Ja — hele teksten til “Multimodal RAG med billeder og tabeller” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af LangChain / RAG / vektordatabaser-kurset, skal du opgradere til CoddyKit PRO. LangChain / RAG / vektordatabaser-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Multimodal RAG med billeder og tabeller”?

Udvid RAG ud over ren tekst, så De kan hente og ræsonnere over billeder, diagrammer og strukturerede tabeller. Du øver dig i LangChain / RAG / vektordatabaser med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på LangChain / RAG / vektordatabaser?

Der kræves ingen tidligere erfaring. LangChain / RAG / vektordatabaser på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 4 af 4.

Hvor lang tid tager lektionen “Multimodal RAG med billeder og tabeller”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne LangChain / RAG / vektordatabaser-lektion?

Ja. Alle LangChain / RAG / vektordatabaser-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. RAG til kodegenerering og -assistance
  2. Opbygning af RAG-systemer i realtid
  3. Nye tendenser og forskning inden for RAG
  4. Multimodal RAG med billeder og tabeller
← Tilbage til LangChain / RAG / vektordatabaser