NLP Academy · Les

Documenten chunken en embedden

Bereid een doorzoekbare kennisbank voor

Les 2 van 413 stappen

Documenten chunken en embedden is een gratis NLP Academy-les op CoddyKit. Dit is les 2 van 4. Je kunt 3 lessen uit dit leerpad gratis volledig lezen — daarna ontgrendelt CoddyKit PRO alle lessen, plus praktische oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject NLP Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus NLP Academy bevat in totaal 4 lessen.

Documenten zijn te groot om in hun geheel te doorzoeken

Een lange pdf bevat vaak meerdere onderwerpen tegelijk. Om nauwkeurig te kunnen ophalen, splits je deze eerst op in kleinere delen die fragmenten worden genoemd.

Wat een goed fragment kenmerkt

Een goed fragment bevat één samenhangende gedachte: een of twee alinea's. Een te groot fragment verbergt het antwoord; een te klein fragment verliest de omliggende context.

Splitsen op grootte

De eenvoudigste methode knipt tekst na een vast aantal tekens of tokens. Dat is snel, maar kan een zin doormidden knippen.

chunks = [text[i:i+500] for i in range(0, len(text), 500)]

Overlappende fragmenten

Om te voorkomen dat je een gedachte uit elkaar knipt, laat je fragmenten een overlap hebben. Door de laatste regels te herhalen, blijft de context over de grenzen heen doorlopen.

Splitsen op structuur

Betere splitsers knippen eerst op alinea's of koppen. Door de structuur te respecteren, blijft elk fragment bij één duidelijk onderwerp.

Van tekst naar vectoren

Zoeken heeft getallen nodig, geen woorden. Een vectorinbedding zet elk fragment om in een dichte vector die de betekenis ervan vastlegt.

Betekenis zit in afstand

Vectorinbeddingen plaatsen vergelijkbare tekst dicht bij elkaar. Twee fragmenten over hetzelfde idee liggen dicht bij elkaar in de vectorruimte.

Een inbeddingsmodel aanroepen

Je geeft tekst door aan een inbeddingsmodel en krijgt een lijst met kommagetallen terug. Hetzelfde model moet zowel fragmenten als zoekopdrachten coderen.

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("all-MiniLM-L6-v2")

Je fragmenten coderen

Haal elk fragment door het model om de bijbehorende vector op te bouwen. Eén aanroep kan voor snelheid de hele lijst tegelijk coderen.

vectors = model.encode(chunks)

Vectordimensies

Elke vector heeft een vaste lengte: zijn dimensie. Een klein model kan 384 getallen opleveren; grotere modellen leveren er 768 of meer.

print(vectors.shape)  # (n_chunks, 384)

Fragment en vector samen opslaan

Koppel elke vector aan de oorspronkelijke tekst en bron. Later haal je resultaten op via de vector, maar toon je het voor mensen leesbare fragment.

Korte controle

Denk na over waarom we een overlap toevoegen bij het splitsen van documenten.

Samenvatting

Je splitst documenten op in fragmenten, eventueel met overlap, en zet elk fragment daarna om in een vector. Sla tekst en vector samen op om ze later te kunnen ophalen. ✅

Gratis beginnen

Leer Python met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
30
Lessen
120

Veelgestelde vragen

Is de les “Documenten chunken en embedden” gratis?

Ja — je kunt hier op het web alle 3 lessen van het leerpad NLP Academy, waaronder “Documenten chunken en embedden”, gratis volledig lezen. Daarna ontgrendelt CoddyKit PRO alle lessen, plus interactieve oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. De cursus NLP Academy bevat in totaal 4 lessen.

Wat leer ik in “Documenten chunken en embedden”?

Bereid een doorzoekbare kennisbank voor Je oefent met NLP Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met NLP Academy te beginnen?

Ervaring vooraf is niet nodig. NLP Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 2 van 4.

Hoe lang duurt de les “Documenten chunken en embedden”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over NLP Academy?

Ja. Elke les over NLP Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Waarom LLM's retrieval nodig hebben
  2. Documenten chunken en embedden
  3. Vector search met een vector store
  4. Retrieval in de prompt verwerken
← Terug naar NLP Academy