Tekst chunken voor betere embeddings
Leer documenten op te splitsen in chunks die goed kunnen worden geëmbed, waarom chunkgrootte en overlap belangrijk zijn en welke strategieën de retrievalkwaliteit maximaliseren.
Tekst chunken voor betere embeddings is een gratis Vectordatabases: Pinecone, Weaviate en pgvector-les op CoddyKit. Dit is les 4 van 4. Je kunt 3 lessen uit dit leerpad gratis volledig lezen — daarna ontgrendelt CoddyKit PRO alle lessen, plus praktische oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Vectordatabases: Pinecone, Weaviate en pgvector. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Vectordatabases: Pinecone, Weaviate en pgvector bevat in totaal 4 lessen.
Waarom chunking belangrijk is
Inbeddingsmodellen hebben een tokenlimiet en produceren één vector per invoer. Als je een heel document invoert, krijg je een vage, gemiddelde vector. Met chunking splits je tekst op in gerichte stukken, zodat elke vector een specifiek idee vastlegt.
Het Goudlokjeprobleem
De grootte van chunks is een balans:
- Te groot — verwaterde betekenis, gemengde onderwerpen in één vector
- Te klein — fragmenten verliezen context en er zijn meer vectoren om op te slaan
Richt je op chunks die één samenhangende gedachte bevatten.
Chunking met vaste grootte
De eenvoudigste methode: splits elke N tekens of tokens.
def chunk(text, size):
return [text[i:i+size] for i in range(0, len(text), size)]
print(chunk('abcdefghij', 4))De truc met overlap
Bij vaste splitsingen kan een zin doormidden worden geknipt, waardoor context aan de grens verloren gaat. Met overlap herhaal je de laatste paar tokens van een chunk aan het begin van de volgende, zodat ideeën die over een grens heen lopen behouden blijven.
def chunk_overlap(text, size, overlap):
out = []
i = 0
while i < len(text):
out.append(text[i:i+size])
i += size - overlap
return out
print(chunk_overlap('abcdefghij', 4, 1))Chunking met aandacht voor zinnen
Beter dan blind splitsen op tekens: splits op grenzen tussen zinnen en groepeer zinnen vervolgens tot een beoogde grootte. Chunks eindigen netjes en vormen een samenhangend geheel.
Recursieve chunking
Bij recursief splitsen worden eerst grote scheidingstekens geprobeerd (alinea's) en daarna kleinere (zinnen en vervolgens woorden), totdat de chunks binnen de groottelimiet passen. Zo blijft de documentstructuur behouden en wordt de maximale grootte gegarandeerd.
Chunking met aandacht voor structuur
Splits Markdown, code of HTML op basis van structurele elementen:
- Markdown-koppen en -secties
- Codefuncties of -klassen
- HTML-secties en -lijsten
Zo blijft gerelateerde inhoud bij elkaar.
Tokens tellen
Modellen beperken de invoer op basis van tokens, niet tekens. Schat het aantal tokens vóór het maken van inbeddingen, zodat chunks binnen het modelvenster passen.
def approx_tokens(text):
return max(1, len(text) // 4)
print(approx_tokens('The quick brown fox jumps'))Chunks afstemmen op zoekopdrachten
Denk na over hoe gebruikers zoeken. Als vragen gericht zijn op korte feiten, verbeteren kleinere chunks de precisie. Als vragen brede context nodig hebben, helpen grotere chunks. Soms sla je beide granulariteiten op.
Context toevoegen aan chunks
Een chunk die uit zijn context is gehaald, kan dubbelzinnig zijn. Zet vóór het maken van de inbedding een korte kop (documenttitel, sectienaam) voor elke chunk, zodat de vector weet waar die vandaan komt.
Itereren en meten
Er bestaat geen universeel beste chunkgrootte. Kies een beginpunt (vaak een paar honderd tokens met beperkte overlap), meet vervolgens de kwaliteit van het ophalen en pas de instellingen aan. Chunking is een experiment, geen vaste regel.
Korte controle
Test je begrip van overlap tussen chunks.
Samenvatting
Je hebt geleerd dat chunking documenten omzet in gerichte stukken die geschikt zijn voor inbeddingen. Breng de chunkgrootte in balans, voeg overlap toe om context aan grenzen te behouden, geef de voorkeur aan splitsen met aandacht voor zinnen of recursief splitsen, tel tokens, verrijk chunks met contextkoppen en blijf itereren terwijl je de kwaliteit van het ophalen meet.
Leer Vectordatabases: Pinecone, Weaviate en pgvector met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 12
- Lessen
- 48
Veelgestelde vragen
Is de les “Tekst chunken voor betere embeddings” gratis?
Ja — je kunt hier op het web alle 3 lessen van het leerpad Vectordatabases: Pinecone, Weaviate en pgvector, waaronder “Tekst chunken voor betere embeddings”, gratis volledig lezen. Daarna ontgrendelt CoddyKit PRO alle lessen, plus interactieve oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. De cursus Vectordatabases: Pinecone, Weaviate en pgvector bevat in totaal 4 lessen.
Wat leer ik in “Tekst chunken voor betere embeddings”?
Leer documenten op te splitsen in chunks die goed kunnen worden geëmbed, waarom chunkgrootte en overlap belangrijk zijn en welke strategieën de retrievalkwaliteit maximaliseren. Je oefent met Vectordatabases: Pinecone, Weaviate en pgvector door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met Vectordatabases: Pinecone, Weaviate en pgvector te beginnen?
Ervaring vooraf is niet nodig. Vectordatabases: Pinecone, Weaviate en pgvector op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 4.
Hoe lang duurt de les “Tekst chunken voor betere embeddings”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over Vectordatabases: Pinecone, Weaviate en pgvector?
Ja. Elke les over Vectordatabases: Pinecone, Weaviate en pgvector bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Modellen voor text embeddings
- Embedding-API's gebruiken
- Embeddings opslaan en bijwerken
- Tekst chunken voor betere embeddings