Multimodale RAG met afbeeldingen en tabellen
Breid RAG uit voorbij platte tekst en haal afbeeldingen, grafieken en gestructureerde tabellen op en redeneer daarover.
Multimodale RAG met afbeeldingen en tabellen is een gratis LangChain / RAG / vectordatabases-les op CoddyKit. Dit is les 4 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject LangChain / RAG / vectordatabases. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus LangChain / RAG / vectordatabases bevat in totaal 4 lessen.
Verder dan platte tekst
Echte documenten bevatten afbeeldingen, grafieken en tabellen. Multimodale RAG indexeert en haalt deze niet-tekstelementen op, zodat het model vragen kan beantwoorden die ervan afhangen.
Wat geldt als multimodaal?
Multimodale bronnen zijn onder andere gescande pagina's, diagrammen, schermafbeeldingen, foto's en tabellen in spreadsheetstijl die in PDF's of webpagina's zijn opgenomen.
- Afbeeldingen
- Grafieken en figuren
- Tabellen
Strategie 1: beschrijven en daarna embedden
Gebruik een visiemodel om een tekstuele beschrijving van elke afbeelding te genereren en embed die beschrijving vervolgens met je normale tekstembeddings. Het ophalen blijft op tekst gebaseerd.
caption = vision_model.describe(image)
store.add_texts([caption], metadatas=[{"image": image_id}])Strategie 2: multimodale embeddings
Modellen zoals CLIP embedden afbeeldingen en tekst in dezelfde vectorruimte, zodat een tekstuele vraag rechtstreeks bij een afbeelding kan passen zonder tussenstap met een bijschrift.
Tabellen verwerken
Tabellen verliezen hun betekenis wanneer je ze afvlakt. Behoud de structuur door elke tabel vóór het opdelen om te zetten naar Markdown of HTML, zodat rijen en kopteksten gekoppeld blijven.
table_md = "| Year | Revenue |\n|---|---|\n| 2024 | 10M |\n| 2025 | 12M |"
store.add_texts([table_md], metadatas=[{"type": "table"}])Grote tabellen samenvatten
Sla voor brede of lange tabellen zowel een samenvatting in natuurlijke taal (voor het ophalen) als de onbewerkte tabel (voor het antwoord) op en koppel ze met een id.
Routeren op basis van modaliteit
Bepaal bij elke vraag wat ervoor nodig is. Bij een vraag over een grafiek haal je afbeeldingselementen op; voor het opzoeken van een getal richt je je op tabellen.
Afbeeldingen aan de LLM doorgeven
Multimodale LLM's accepteren rechtstreeks afbeeldingen in de prompt. Voeg na het ophalen van de relevante afbeelding die afbeelding samen met de vraag toe voor onderbouwde redenering.
messages = [{"role": "user", "content": [
{"type": "text", "text": "What trend does this chart show?"},
{"type": "image_url", "image_url": {"url": img_url}},
]}]Visuele bronnen vermelden
Houd in metagegevens bij welke afbeelding of tabel een antwoord heeft opgeleverd, zodat je de gebruiker precies de figuur of tabel kunt tonen waarop het model zich baseerde.
Kosten en wachttijd
Visie-aanroepen en afbeeldingsembeddings kosten meer dan tekst. Cache bijschriften, verklein afbeeldingen en gebruik visie alleen wanneer de vraag dit echt vereist.
Alles samenbrengen
Haal afbeeldingen en tabellen tijdens het laden uit de documenten, indexeer ze via bijschriften of multimodale embeddings, routeer vragen op basis van modaliteit en geef het juiste element door aan een multimodale LLM.
Korte kennistest
Test je begrip van multimodale RAG.
Samenvatting
Je hebt RAG uitgebreid naar meerdere modaliteiten:
- Beschrijven en daarna embedden of multimodale embeddings voor afbeeldingen
- Behoud de structuur van tabellen als Markdown
- Routeer vragen op basis van modaliteit
- Geef afbeeldingen door aan een multimodale LLM en vermeld visuele bronnen
Leer LangChain / RAG / vectordatabases met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 12
- Lessen
- 48
Veelgestelde vragen
Is de les “Multimodale RAG met afbeeldingen en tabellen” gratis?
Ja — de volledige tekst van “Multimodale RAG met afbeeldingen en tabellen” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus LangChain / RAG / vectordatabases wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus LangChain / RAG / vectordatabases bevat in totaal 4 lessen.
Wat leer ik in “Multimodale RAG met afbeeldingen en tabellen”?
Breid RAG uit voorbij platte tekst en haal afbeeldingen, grafieken en gestructureerde tabellen op en redeneer daarover. Je oefent met LangChain / RAG / vectordatabases door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met LangChain / RAG / vectordatabases te beginnen?
Ervaring vooraf is niet nodig. LangChain / RAG / vectordatabases op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 4.
Hoe lang duurt de les “Multimodale RAG met afbeeldingen en tabellen”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over LangChain / RAG / vectordatabases?
Ja. Elke les over LangChain / RAG / vectordatabases bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- RAG voor codegeneratie en ondersteuning
- Realtime RAG-systemen bouwen
- Nieuwe trends en onderzoek in RAG
- Multimodale RAG met afbeeldingen en tabellen