Leer AI met Python · Les

Tokenisatie en normalisatie

Technieken voor tekstvoorbewerking

Les 2 van 510 stappen

Tokenisatie en normalisatie is een gratis Leer AI met Python-les op CoddyKit. Dit is les 2 van 5. Je kunt 3 lessen uit dit leerpad gratis volledig lezen — daarna ontgrendelt CoddyKit PRO alle lessen, plus praktische oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Leer AI met Python. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Leer AI met Python bevat in totaal 5 lessen.

Basisbeginselen van tekstvoorbewerking

Tokenisatie en normalisatie

Tekstvoorbewerking is een cruciale stap in NLP. Hierbij wordt onbewerkte tekst omgezet naar een gestructureerde indeling voor analyse. Belangrijke stappen in de voorbewerking zijn tokenisatie en normalisatie.

Tokenisatie en normalisatie — illustratie 1

Wat is tokenisatie?

Tokenisatie is het proces waarbij tekst wordt opgesplitst in kleinere eenheden, die tokens worden genoemd. Tokens kunnen woorden, zinnen of tekens zijn.

Bijvoorbeeld:

Tekst: "NLP is amazing!"

Tokens: ["NLP", "is", "amazing", "!"]

Voorbeeld van tokenisatie in Python

Met de bibliotheek NLTK kunnen we tekst in woorden of zinnen tokeniseren:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

Wat is normalisatie?

Bij normalisatie wordt tekst opgeschoond en gestandaardiseerd. Veelgebruikte normalisatietechnieken zijn:

  • Kleine letters: Alle tekst omzetten naar kleine letters.
  • Interpunctie verwijderen: Interpunctietekens verwijderen.
  • Stammen: Woorden terugbrengen tot hun stam door bijvoorbeeld "rennen" → "ren".
  • Lemmatisering: Woorden met behulp van de context terugbrengen tot hun betekenisvolle grondvorm, bijvoorbeeld "beter" → "goed".

Kleine letters gebruiken en interpunctie verwijderen

Zo normaliseer je tekst door deze om te zetten naar kleine letters en interpunctie te verwijderen:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

Stammen en lemmatisering

Stammen: Brengt woorden terug tot hun stam door achtervoegsels af te kappen. Dit gebeurt op basis van regels en levert niet altijd geldige woorden op.

Lemmatisering: Gebruikt een woordenlijst en grammaticaregels om woorden terug te brengen tot hun betekenisvolle grondvorm.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

Stopwoorden verwijderen

Stopwoorden zijn veelvoorkomende woorden, zoals "is", "en" en "de", die vaak geen belangrijke betekenis hebben. Door ze te verwijderen, kun je tekstanalyse vereenvoudigen:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

Uitdagingen bij tekstvoorbewerking

Tekstvoorbewerking kan lastig zijn vanwege:

  • Dubbelzinnigheid: Woorden zoals "bank" kunnen meerdere betekenissen hebben.
  • Context: Voor lemmatisering is inzicht in de context van een woord nodig.
  • Taalvariatie: Omgaan met verschillende talen en dialecten.

Samenvatting en volgende stappen

In deze les hebben we:

  • Geleerd over tokenisatie en normalisatie.
  • Technieken zoals stamvorming, lemmatisering en verwijdering van stopwoorden verkend.
  • Tekstvoorbewerking met Python geoefend.

Vervolgens analyseren we tekstpatronen met N-grammodellen.

Tokenisatie en normalisatie — illustratie 10
Gratis beginnen

Leer Python met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
53
Lessen
225

Veelgestelde vragen

Is de les “Tokenisatie en normalisatie” gratis?

Ja — je kunt hier op het web alle 3 lessen van het leerpad Leer AI met Python, waaronder “Tokenisatie en normalisatie”, gratis volledig lezen. Daarna ontgrendelt CoddyKit PRO alle lessen, plus interactieve oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. De cursus Leer AI met Python bevat in totaal 5 lessen.

Wat leer ik in “Tokenisatie en normalisatie”?

Technieken voor tekstvoorbewerking Je oefent met Leer AI met Python door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met Leer AI met Python te beginnen?

Ervaring vooraf is niet nodig. Leer AI met Python op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 2 van 5.

Hoe lang duurt de les “Tokenisatie en normalisatie”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over Leer AI met Python?

Ja. Elke les over Leer AI met Python bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Werken met tekstgegevens
  2. Tokenisatie en normalisatie
  3. N-grammodellen
  4. Concepten van sentimentanalyse
  5. Modellen op basis van transformers
← Terug naar Leer AI met Python