Tokenizen en een vocabulaire opbouwen
Wijs tekst toe aan gehele getallen als id's.
Tokenizen en een vocabulaire opbouwen is een gratis Deep Learning Academy-les op CoddyKit. Dit is les 1 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Deep Learning Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Deep Learning Academy bevat in totaal 4 lessen.
Netwerken verwerken alleen getallen
Een neuraal netwerk kan onbewerkte letters niet lezen. Voordat het leren begint, moet je tekst omzetten in getallen die het model kan verwerken. 🔢
Eerste stap: tokeniseren
Tokeniseren betekent dat je tekst opsplitst in kleine stukjes die tokens heten. De eenvoudigste keuze is om een zin op spaties in woorden te splitsen.
text = "I love deep learning"
tokens = text.split()
# ["I", "love", "deep", "learning"]Tokens kunnen kleiner zijn
Een token hoeft geen volledig woord te zijn. Het kan ook een teken of een deel van een woord zijn, zodat het model zeldzame of onbekende woorden beter kan verwerken.
Bouw een woordenlijst
Een woordenlijst is de volledige verzameling unieke tokens die je model kent. Je verzamelt elk verschillend token uit je trainingsgegevens.
Geef elk token een id
Elk uniek token krijgt één geheel getal als id. Dankzij deze koppeling van token aan id kunnen woorden worden omgezet in getallen die het netwerk kan indexeren.
vocab = {"i": 0, "love": 1, "deep": 2, "learning": 3}Codeer een zin
Om tekst te coderen, zoek je elk token op in de woordenlijst en vervang je het door zijn id. Zo ontstaat een lijst gehele getallen.
ids = [vocab[t] for t in ["i", "love", "deep"]]
# [0, 1, 2]Verwerk onbekende woorden
Sommige tokens die je tijdens het testen tegenkomt, zijn nooit in de training gezien. Koppel ze aan een speciaal onbekend token, zodat het model toch een geldige id krijgt.
unk_id = vocab.get("dragons", vocab["<unk>"])Speciale tokens helpen
Voeg speciale tokens toe, zoals opvul-, begin- en eindmarkeringen. Ze geven het model meer structuur dan alleen de woorden zelf.
Maak kleine letters en ruim op
Door tekst te normaliseren met kleine letters en door leestekens te verwijderen, verklein je de woordenlijst, zodat Cat en cat dezelfde id delen.
Beperk de grootte van de woordenlijst
Echte tekstverzamelingen hebben enorme woordenlijsten. Behoud alleen de meest voorkomende tokens om de grootte van de woordenlijst beheersbaar te houden; de rest wordt onbekend.
Tekst is nu een tensor
Na het coderen is een zin een lijst ids die je in een tensor kunt plaatsen. De verwerkingspijplijn van onbewerkte tekst naar modelinvoer is nu compleet.
import torch
ids = torch.tensor([0, 1, 2, 3])Korte controle
Wat krijgt elk uniek token bij het opbouwen van een woordenlijst?
Samenvatting
Je splitst tekst op in tokens, verzamelt de unieke tokens in een woordenlijst en koppelt elk token aan een geheel getal, zodat tekst getallen wordt. ✅
Leer Python met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 30
- Lessen
- 120
Veelgestelde vragen
Is de les “Tokenizen en een vocabulaire opbouwen” gratis?
Ja — de volledige tekst van “Tokenizen en een vocabulaire opbouwen” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus Deep Learning Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus Deep Learning Academy bevat in totaal 4 lessen.
Wat leer ik in “Tokenizen en een vocabulaire opbouwen”?
Wijs tekst toe aan gehele getallen als id's. Je oefent met Deep Learning Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met Deep Learning Academy te beginnen?
Ervaring vooraf is niet nodig. Deep Learning Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 1 van 4.
Hoe lang duurt de les “Tokenizen en een vocabulaire opbouwen”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over Deep Learning Academy?
Ja. Elke les over Deep Learning Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Tokenizen en een vocabulaire opbouwen
- nn.Embedding: leerbare woordvectoren
- Waarom embeddings betekenis vastleggen
- Een tekstclassificatiemodel trainen