LangChain / RAG / vektordatabaser · Lektion

Multimodal RAG med bilder och tabeller

Utöka RAG bortom vanlig text genom att hämta och resonera över bilder, diagram och strukturerade tabeller.

Lektion 4 av 413 steg

Multimodal RAG med bilder och tabeller är en gratis lektion i LangChain / RAG / vektordatabaser på CoddyKit. Detta är lektion 4 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för LangChain / RAG / vektordatabaser, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i LangChain / RAG / vektordatabaser innehåller totalt 4 lektioner.

Bortom vanlig text

Verkliga dokument innehåller bilder, diagram och tabeller. Multimodal RAG indexerar och hämtar dessa icke-textuella element, så att modellen kan besvara frågor som bygger på dem.

Vad räknas som multimodalt?

Multimodala källor omfattar skannade sidor, diagram, skärmbilder, foton och tabeller i kalkylbladsstil som är inbäddade i PDF-filer eller webbsidor.

  • Bilder
  • Diagram och figurer
  • Tabeller

Strategi 1: Beskriv och bädda sedan in

Använd en synmodell för att skapa en textbeskrivning av varje bild och bädda sedan in beskrivningen med dina vanliga textembeddings. Hämtningen förblir textbaserad.

caption = vision_model.describe(image)
store.add_texts([caption], metadatas=[{"image": image_id}])

Strategi 2: Multimodala embeddings

Modeller som CLIP bäddar in bilder och text i samma vektorrum, så att en textfråga kan matcha en bild direkt utan ett separat bildtextsteg.

Hantera tabeller

Tabeller förlorar sin betydelse när de plattas ut. Bevara strukturen genom att konvertera varje tabell till Markdown eller HTML före chunkningen, så att rader och rubriker förblir kopplade.

table_md = "| Year | Revenue |\n|---|---|\n| 2024 | 10M |\n| 2025 | 12M |"
store.add_texts([table_md], metadatas=[{"type": "table"}])

Sammanfatta stora tabeller

För breda eller långa tabeller ska du lagra både en sammanfattning på naturligt språk, för hämtning, och den råa tabellen, för svaret, och länka samman dem med ett id.

Dirigera efter modalitet

Identifiera vid frågetillfället vad frågan kräver. En fråga om ett diagram bör hämta bildelement, medan en numerisk uppslagning bör riktas mot tabeller.

Skicka bilder till LLM:en

Multimodala LLM:er kan ta emot bilder direkt i prompten. När du har hämtat den relevanta bilden inkluderar du den tillsammans med frågan för förankrat resonemang.

messages = [{"role": "user", "content": [
    {"type": "text", "text": "What trend does this chart show?"},
    {"type": "image_url", "image_url": {"url": img_url}},
]}]

Citera visuella källor

Spåra vilken bild eller tabell som gav upphov till ett svar i metadata, så att du kan visa användaren den exakta figur eller tabell som modellen använde.

Kostnad och svarstid

Synanrop och bildembeddings kostar mer än text. Cachelagra bildtexter, skala ned bilder och använd bara synmodellen när frågan verkligen kräver det.

Sätt ihop allt

Extrahera bilder och tabeller vid inläsningen, indexera dem via bildtexter eller multimodala embeddings, dirigera frågor efter modalitet och skicka rätt element till en multimodal LLM.

Snabbtest

Testa din förståelse av multimodal RAG.

Sammanfattning

Du har utökat RAG till flera modaliteter:

  • Beskriv och bädda in eller multimodala embeddings för bilder
  • Bevara tabellens struktur som Markdown
  • Dirigera frågor efter modalitet
  • Skicka bilder till en multimodal LLM och citera visuella källor
Gratis att börja

Lär dig LangChain / RAG / vektordatabaser med en AI-lärare – gratis

Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.

Kurser
12
Lektioner
48

Vanliga frågor

Är lektionen ”Multimodal RAG med bilder och tabeller” gratis?

Ja – hela texten till ”Multimodal RAG med bilder och tabeller” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i LangChain / RAG / vektordatabaser, kan Ni uppgradera till CoddyKit PRO. Kursen i LangChain / RAG / vektordatabaser innehåller totalt 4 lektioner.

Vad lär jag mig i ”Multimodal RAG med bilder och tabeller”?

Utöka RAG bortom vanlig text genom att hämta och resonera över bilder, diagram och strukturerade tabeller. Ni övar på LangChain / RAG / vektordatabaser med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.

Behöver jag någon erfarenhet för att börja lära mig LangChain / RAG / vektordatabaser?

Du behöver inga förkunskaper. Utbildningen i LangChain / RAG / vektordatabaser på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 4 av 4.

Hur lång tid tar lektionen ”Multimodal RAG med bilder och tabeller”?

De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.

Kan jag skriva och köra kod i den här LangChain / RAG / vektordatabaser-lektionen?

Ja. Varje LangChain / RAG / vektordatabaser-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.

Alla lektioner i den här kursen

  1. RAG för kodgenerering och kodassistans
  2. Bygga RAG-system i realtid
  3. Nya trender och forskning inom RAG
  4. Multimodal RAG med bilder och tabeller
← Tillbaka till LangChain / RAG / vektordatabaser