Documentloaders uitgelegd
Ontdek hoe u gegevens uit uiteenlopende bronnen, zoals pdf’s, webpagina’s en databases, in een bruikbaar formaat voor LangChain laadt
Documentloaders uitgelegd is een gratis AI-agents met LangChain en autonome werkstromen-les op CoddyKit. Dit is les 1 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject AI-agents met LangChain en autonome werkstromen. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus AI-agents met LangChain en autonome werkstromen bevat in totaal 4 lessen.
Gegevens voor slimmere LLM's
Large Language Models (LLM's) zijn krachtig, maar hun kennis is beperkt tot hun trainingsgegevens. Om AI-agents echt nuttig te maken, hebben ze vaak toegang nodig tot actuele, externe informatie.
- Stel je een agent voor die vragen over het nieuws van vandaag moet beantwoorden.
- Of een agent die een specifiek document van de interne schijf van je bedrijf samenvat.
Hier komt gegevens laden van pas.
Wat zijn documentladers?
Documentladers zijn de manier waarop LangChain externe gegevens beschikbaar maakt in de workflow van je agent. Ze fungeren als bruggen die onbewerkte gegevens uit verschillende bronnen omzetten naar een gestandaardiseerd formaat dat LLM's kunnen begrijpen.
Je kunt ze zien als gespecialiseerde gegevensconnectoren. Ze verwerken de lastige details van het lezen van bestanden, ophalen van webpagina's of bevragen van databases, en bieden de gegevens vervolgens overzichtelijk aan LangChain aan.
Het Document-object van LangChain
Wanneer een lader gegevens ophaalt, verpakt deze die in een Document-object. Dit is de universele container van LangChain voor gegevens.
Elk Document heeft doorgaans twee hoofdonderdelen:
page_content: de daadwerkelijke tekstinhoud die uit de bron is gehaald, bijvoorbeeld de tekst van een PDF-pagina of webartikel.metadata: een woordenboek met aanvullende informatie over het document, zoals de URL van de bron, het paginanummer, het bestandspad en de aanmaakdatum.
Gegevens uit lokale tekstbestanden laden
Een van de eenvoudigste manieren om gegevens te laden is vanuit een gewoon tekstbestand op je computer. LangChain biedt hiervoor TextLoader.
Deze neemt een bestandspad aan, leest de inhoud en maakt een Document-object. Laten we bekijken hoe dit werkt door een tijdelijk bestand te maken en het te laden.
TextLoader in actie
Dit voorbeeld maakt een tijdelijk tekstbestand, schrijft er inhoud in en gebruikt vervolgens TextLoader om het te lezen en het resultaat af te drukken.
from langchain_community.document_loaders import TextLoader
import os
import tempfile
if __name__ == "__main__":
# Create a temporary file
with tempfile.NamedTemporaryFile(mode='w', delete=False, encoding='utf-8') as temp_file:
temp_file.write("Hello CoddyKit!\nThis is a test document.")
temp_file_path = temp_file.name
print(f"Created temp file: {temp_file_path}")
try:
# Load the document using TextLoader
loader = TextLoader(temp_file_path)
documents = loader.load()
# Print the content of the loaded document
for doc in documents:
print("--- Document Content ---")
print(doc.page_content)
print("--- Metadata ---")
print(doc.metadata)
finally:
# Clean up the temporary file
os.remove(temp_file_path)
print(f"Cleaned up temp file: {temp_file_path}")Webinhoud met WebBaseLoader
Wat als je gegevens op internet staan? WebBaseLoader is ideaal om inhoud rechtstreeks van webpagina's op te halen.
Deze lader is slim genoeg om de hoofdtekst te extraheren en navigatie, advertenties en andere irrelevante elementen te negeren. Je hoeft alleen de URL op te geven!
Voorbeeld van WebBaseLoader
Zo haal je inhoud op van een eenvoudige voorbeeldwebpagina. Let op: voor deze lader moeten doorgaans beautifulsoup4 en lxml zijn geïnstalleerd.
from langchain_community.document_loaders import WebBaseLoader
if __name__ == "__main__":
# Define the URL to load
url = "https://www.google.com/search?q=hello"
print(f"Loading content from: {url}")
# Initialize the WebBaseLoader
loader = WebBaseLoader(url)
# Load the documents
documents = loader.load()
# Print the content of the first loaded document
if documents:
print("--- Extracted Content (first 200 chars) ---")
print(documents[0].page_content[:200] + "...")
print("--- Metadata ---")
print(documents[0].metadata)
else:
print("No documents loaded.")PDF's en gestructureerde documenten
Gegevens uit PDF's laden is een veelvoorkomende vereiste. LangChain biedt laders zoals PyPDFLoader (die de bibliotheek pypdf gebruikt) om dit af te handelen.
Deze laders zijn ontworpen om tekst uit complexe indelingen te extraheren en vaak een deel van de structuur te behouden. Bij PDF's kan elke pagina bijvoorbeeld een afzonderlijk Document-object worden, met metagegevens die het paginanummer aangeven.
Er zijn ook laders voor andere indelingen, zoals CSV, JSON en Markdown, en zelfs voor specifieke gegevensstructuren zoals Notion-databases of Confluence-pagina's.
Verder dan bestanden: databaseladers
Je gegevens kunnen in databases staan. LangChain ondersteunt verschillende databaseladers om rechtstreeks verbinding te maken met je gegevensbronnen:
- SQL-databaselader: maakt verbinding met relationele databases (zoals PostgreSQL en MySQL) om gegevens op te halen op basis van query's.
- MongoDB-lader: voor NoSQL-documentdatabases.
- Elasticsearch-lader: om gegevens uit Elasticsearch-indexen op te halen.
Met deze laders kunnen je agents dynamisch query's uitvoeren op en gegevens ophalen uit je bestaande gegevensinfrastructuur.
Korte controle
Welke van de volgende opties is GEEN hoofddoel van een LangChain-documentlader?
Terugblik: documentladers
In deze les hebben we de Document Loaders van LangChain verkend: essentiële hulpmiddelen om externe gegevens in je AI-agents te laden.
- Loaders zetten verschillende gegevensbronnen (tekstbestanden, webpagina's, pdf's en databases) om in het universele
Document-object van LangChain. - Elk
Documentbevatpage_contentenmetadata. - We hebben praktische voorbeelden gezien met
TextLoadervoor lokale bestanden enWebBaseLoadervoor webinhoud.
Vervolgens leer je hoe je grote documenten verwerkt door ze op te splitsen in hanteerbare stukken.
Leer AI-agents met LangChain en autonome werkstromen met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 12
- Lessen
- 50
Veelgestelde vragen
Is de les “Documentloaders uitgelegd” gratis?
Ja — de volledige tekst van “Documentloaders uitgelegd” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus AI-agents met LangChain en autonome werkstromen wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus AI-agents met LangChain en autonome werkstromen bevat in totaal 4 lessen.
Wat leer ik in “Documentloaders uitgelegd”?
Ontdek hoe u gegevens uit uiteenlopende bronnen, zoals pdf’s, webpagina’s en databases, in een bruikbaar formaat voor LangChain laadt Je oefent met AI-agents met LangChain en autonome werkstromen door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met AI-agents met LangChain en autonome werkstromen te beginnen?
Ervaring vooraf is niet nodig. AI-agents met LangChain en autonome werkstromen op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 1 van 4.
Hoe lang duurt de les “Documentloaders uitgelegd”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over AI-agents met LangChain en autonome werkstromen?
Ja. Elke les over AI-agents met LangChain en autonome werkstromen bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Documentloaders uitgelegd
- Text splitters en embeddings
- Vector stores voor retrieval
- Retrievers en contextuele compressie