Vectordatabases: Pinecone, Weaviate en pgvector · Les

Tekst chunken voor betere embeddings

Leer documenten op te splitsen in chunks die goed kunnen worden geëmbed, waarom chunkgrootte en overlap belangrijk zijn en welke strategieën de retrievalkwaliteit maximaliseren.

Les 4 van 413 stappen

Tekst chunken voor betere embeddings is een gratis Vectordatabases: Pinecone, Weaviate en pgvector-les op CoddyKit. Dit is les 4 van 4. Je kunt 3 lessen uit dit leerpad gratis volledig lezen — daarna ontgrendelt CoddyKit PRO alle lessen, plus praktische oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Vectordatabases: Pinecone, Weaviate en pgvector. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Vectordatabases: Pinecone, Weaviate en pgvector bevat in totaal 4 lessen.

Waarom chunking belangrijk is

Inbeddingsmodellen hebben een tokenlimiet en produceren één vector per invoer. Als je een heel document invoert, krijg je een vage, gemiddelde vector. Met chunking splits je tekst op in gerichte stukken, zodat elke vector een specifiek idee vastlegt.

Het Goudlokjeprobleem

De grootte van chunks is een balans:

  • Te groot — verwaterde betekenis, gemengde onderwerpen in één vector
  • Te klein — fragmenten verliezen context en er zijn meer vectoren om op te slaan

Richt je op chunks die één samenhangende gedachte bevatten.

Chunking met vaste grootte

De eenvoudigste methode: splits elke N tekens of tokens.

def chunk(text, size):
    return [text[i:i+size] for i in range(0, len(text), size)]

print(chunk('abcdefghij', 4))

De truc met overlap

Bij vaste splitsingen kan een zin doormidden worden geknipt, waardoor context aan de grens verloren gaat. Met overlap herhaal je de laatste paar tokens van een chunk aan het begin van de volgende, zodat ideeën die over een grens heen lopen behouden blijven.

def chunk_overlap(text, size, overlap):
    out = []
    i = 0
    while i < len(text):
        out.append(text[i:i+size])
        i += size - overlap
    return out

print(chunk_overlap('abcdefghij', 4, 1))

Chunking met aandacht voor zinnen

Beter dan blind splitsen op tekens: splits op grenzen tussen zinnen en groepeer zinnen vervolgens tot een beoogde grootte. Chunks eindigen netjes en vormen een samenhangend geheel.

Recursieve chunking

Bij recursief splitsen worden eerst grote scheidingstekens geprobeerd (alinea's) en daarna kleinere (zinnen en vervolgens woorden), totdat de chunks binnen de groottelimiet passen. Zo blijft de documentstructuur behouden en wordt de maximale grootte gegarandeerd.

Chunking met aandacht voor structuur

Splits Markdown, code of HTML op basis van structurele elementen:

  • Markdown-koppen en -secties
  • Codefuncties of -klassen
  • HTML-secties en -lijsten

Zo blijft gerelateerde inhoud bij elkaar.

Tokens tellen

Modellen beperken de invoer op basis van tokens, niet tekens. Schat het aantal tokens vóór het maken van inbeddingen, zodat chunks binnen het modelvenster passen.

def approx_tokens(text):
    return max(1, len(text) // 4)

print(approx_tokens('The quick brown fox jumps'))

Chunks afstemmen op zoekopdrachten

Denk na over hoe gebruikers zoeken. Als vragen gericht zijn op korte feiten, verbeteren kleinere chunks de precisie. Als vragen brede context nodig hebben, helpen grotere chunks. Soms sla je beide granulariteiten op.

Context toevoegen aan chunks

Een chunk die uit zijn context is gehaald, kan dubbelzinnig zijn. Zet vóór het maken van de inbedding een korte kop (documenttitel, sectienaam) voor elke chunk, zodat de vector weet waar die vandaan komt.

Itereren en meten

Er bestaat geen universeel beste chunkgrootte. Kies een beginpunt (vaak een paar honderd tokens met beperkte overlap), meet vervolgens de kwaliteit van het ophalen en pas de instellingen aan. Chunking is een experiment, geen vaste regel.

Korte controle

Test je begrip van overlap tussen chunks.

Samenvatting

Je hebt geleerd dat chunking documenten omzet in gerichte stukken die geschikt zijn voor inbeddingen. Breng de chunkgrootte in balans, voeg overlap toe om context aan grenzen te behouden, geef de voorkeur aan splitsen met aandacht voor zinnen of recursief splitsen, tel tokens, verrijk chunks met contextkoppen en blijf itereren terwijl je de kwaliteit van het ophalen meet.

Gratis beginnen

Leer Vectordatabases: Pinecone, Weaviate en pgvector met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
12
Lessen
48

Veelgestelde vragen

Is de les “Tekst chunken voor betere embeddings” gratis?

Ja — je kunt hier op het web alle 3 lessen van het leerpad Vectordatabases: Pinecone, Weaviate en pgvector, waaronder “Tekst chunken voor betere embeddings”, gratis volledig lezen. Daarna ontgrendelt CoddyKit PRO alle lessen, plus interactieve oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. De cursus Vectordatabases: Pinecone, Weaviate en pgvector bevat in totaal 4 lessen.

Wat leer ik in “Tekst chunken voor betere embeddings”?

Leer documenten op te splitsen in chunks die goed kunnen worden geëmbed, waarom chunkgrootte en overlap belangrijk zijn en welke strategieën de retrievalkwaliteit maximaliseren. Je oefent met Vectordatabases: Pinecone, Weaviate en pgvector door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met Vectordatabases: Pinecone, Weaviate en pgvector te beginnen?

Ervaring vooraf is niet nodig. Vectordatabases: Pinecone, Weaviate en pgvector op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 4.

Hoe lang duurt de les “Tekst chunken voor betere embeddings”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over Vectordatabases: Pinecone, Weaviate en pgvector?

Ja. Elke les over Vectordatabases: Pinecone, Weaviate en pgvector bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Modellen voor text embeddings
  2. Embedding-API's gebruiken
  3. Embeddings opslaan en bijwerken
  4. Tekst chunken voor betere embeddings
← Terug naar Vectordatabases: Pinecone, Weaviate en pgvector