AI-agents met LangChain en autonome werkstromen · Les

Documentloaders uitgelegd

Ontdek hoe u gegevens uit uiteenlopende bronnen, zoals pdf’s, webpagina’s en databases, in een bruikbaar formaat voor LangChain laadt

Les 1 van 411 stappen

Documentloaders uitgelegd is een gratis AI-agents met LangChain en autonome werkstromen-les op CoddyKit. Dit is les 1 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject AI-agents met LangChain en autonome werkstromen. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus AI-agents met LangChain en autonome werkstromen bevat in totaal 4 lessen.

Gegevens voor slimmere LLM's

Large Language Models (LLM's) zijn krachtig, maar hun kennis is beperkt tot hun trainingsgegevens. Om AI-agents echt nuttig te maken, hebben ze vaak toegang nodig tot actuele, externe informatie.

  • Stel je een agent voor die vragen over het nieuws van vandaag moet beantwoorden.
  • Of een agent die een specifiek document van de interne schijf van je bedrijf samenvat.

Hier komt gegevens laden van pas.

Wat zijn documentladers?

Documentladers zijn de manier waarop LangChain externe gegevens beschikbaar maakt in de workflow van je agent. Ze fungeren als bruggen die onbewerkte gegevens uit verschillende bronnen omzetten naar een gestandaardiseerd formaat dat LLM's kunnen begrijpen.

Je kunt ze zien als gespecialiseerde gegevensconnectoren. Ze verwerken de lastige details van het lezen van bestanden, ophalen van webpagina's of bevragen van databases, en bieden de gegevens vervolgens overzichtelijk aan LangChain aan.

Het Document-object van LangChain

Wanneer een lader gegevens ophaalt, verpakt deze die in een Document-object. Dit is de universele container van LangChain voor gegevens.

Elk Document heeft doorgaans twee hoofdonderdelen:

  • page_content: de daadwerkelijke tekstinhoud die uit de bron is gehaald, bijvoorbeeld de tekst van een PDF-pagina of webartikel.
  • metadata: een woordenboek met aanvullende informatie over het document, zoals de URL van de bron, het paginanummer, het bestandspad en de aanmaakdatum.

Gegevens uit lokale tekstbestanden laden

Een van de eenvoudigste manieren om gegevens te laden is vanuit een gewoon tekstbestand op je computer. LangChain biedt hiervoor TextLoader.

Deze neemt een bestandspad aan, leest de inhoud en maakt een Document-object. Laten we bekijken hoe dit werkt door een tijdelijk bestand te maken en het te laden.

TextLoader in actie

Dit voorbeeld maakt een tijdelijk tekstbestand, schrijft er inhoud in en gebruikt vervolgens TextLoader om het te lezen en het resultaat af te drukken.

from langchain_community.document_loaders import TextLoader
import os
import tempfile

if __name__ == "__main__":
    # Create a temporary file
    with tempfile.NamedTemporaryFile(mode='w', delete=False, encoding='utf-8') as temp_file:
        temp_file.write("Hello CoddyKit!\nThis is a test document.")
        temp_file_path = temp_file.name

    print(f"Created temp file: {temp_file_path}")

    try:
        # Load the document using TextLoader
        loader = TextLoader(temp_file_path)
        documents = loader.load()

        # Print the content of the loaded document
        for doc in documents:
            print("--- Document Content ---")
            print(doc.page_content)
            print("--- Metadata ---")
            print(doc.metadata)
    finally:
        # Clean up the temporary file
        os.remove(temp_file_path)
        print(f"Cleaned up temp file: {temp_file_path}")

Webinhoud met WebBaseLoader

Wat als je gegevens op internet staan? WebBaseLoader is ideaal om inhoud rechtstreeks van webpagina's op te halen.

Deze lader is slim genoeg om de hoofdtekst te extraheren en navigatie, advertenties en andere irrelevante elementen te negeren. Je hoeft alleen de URL op te geven!

Voorbeeld van WebBaseLoader

Zo haal je inhoud op van een eenvoudige voorbeeldwebpagina. Let op: voor deze lader moeten doorgaans beautifulsoup4 en lxml zijn geïnstalleerd.

from langchain_community.document_loaders import WebBaseLoader

if __name__ == "__main__":
    # Define the URL to load
    url = "https://www.google.com/search?q=hello"
    print(f"Loading content from: {url}")

    # Initialize the WebBaseLoader
    loader = WebBaseLoader(url)

    # Load the documents
    documents = loader.load()

    # Print the content of the first loaded document
    if documents:
        print("--- Extracted Content (first 200 chars) ---")
        print(documents[0].page_content[:200] + "...")
        print("--- Metadata ---")
        print(documents[0].metadata)
    else:
        print("No documents loaded.")

PDF's en gestructureerde documenten

Gegevens uit PDF's laden is een veelvoorkomende vereiste. LangChain biedt laders zoals PyPDFLoader (die de bibliotheek pypdf gebruikt) om dit af te handelen.

Deze laders zijn ontworpen om tekst uit complexe indelingen te extraheren en vaak een deel van de structuur te behouden. Bij PDF's kan elke pagina bijvoorbeeld een afzonderlijk Document-object worden, met metagegevens die het paginanummer aangeven.

Er zijn ook laders voor andere indelingen, zoals CSV, JSON en Markdown, en zelfs voor specifieke gegevensstructuren zoals Notion-databases of Confluence-pagina's.

Verder dan bestanden: databaseladers

Je gegevens kunnen in databases staan. LangChain ondersteunt verschillende databaseladers om rechtstreeks verbinding te maken met je gegevensbronnen:

  • SQL-databaselader: maakt verbinding met relationele databases (zoals PostgreSQL en MySQL) om gegevens op te halen op basis van query's.
  • MongoDB-lader: voor NoSQL-documentdatabases.
  • Elasticsearch-lader: om gegevens uit Elasticsearch-indexen op te halen.

Met deze laders kunnen je agents dynamisch query's uitvoeren op en gegevens ophalen uit je bestaande gegevensinfrastructuur.

Korte controle

Welke van de volgende opties is GEEN hoofddoel van een LangChain-documentlader?

Terugblik: documentladers

In deze les hebben we de Document Loaders van LangChain verkend: essentiële hulpmiddelen om externe gegevens in je AI-agents te laden.

  • Loaders zetten verschillende gegevensbronnen (tekstbestanden, webpagina's, pdf's en databases) om in het universele Document-object van LangChain.
  • Elk Document bevat page_content en metadata.
  • We hebben praktische voorbeelden gezien met TextLoader voor lokale bestanden en WebBaseLoader voor webinhoud.

Vervolgens leer je hoe je grote documenten verwerkt door ze op te splitsen in hanteerbare stukken.

Gratis beginnen

Leer AI-agents met LangChain en autonome werkstromen met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
12
Lessen
50

Veelgestelde vragen

Is de les “Documentloaders uitgelegd” gratis?

Ja — de volledige tekst van “Documentloaders uitgelegd” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus AI-agents met LangChain en autonome werkstromen wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus AI-agents met LangChain en autonome werkstromen bevat in totaal 4 lessen.

Wat leer ik in “Documentloaders uitgelegd”?

Ontdek hoe u gegevens uit uiteenlopende bronnen, zoals pdf’s, webpagina’s en databases, in een bruikbaar formaat voor LangChain laadt Je oefent met AI-agents met LangChain en autonome werkstromen door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met AI-agents met LangChain en autonome werkstromen te beginnen?

Ervaring vooraf is niet nodig. AI-agents met LangChain en autonome werkstromen op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 1 van 4.

Hoe lang duurt de les “Documentloaders uitgelegd”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over AI-agents met LangChain en autonome werkstromen?

Ja. Elke les over AI-agents met LangChain en autonome werkstromen bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Documentloaders uitgelegd
  2. Text splitters en embeddings
  3. Vector stores voor retrieval
  4. Retrievers en contextuele compressie
← Terug naar AI-agents met LangChain en autonome werkstromen