Tokenisierung und Normalisierung
Techniken zur Textvorverarbeitung
Tokenisierung und Normalisierung ist eine kostenlose Python Academy-Lektion auf CoddyKit. Dies ist Lektion 2 von 5. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Python Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Python Academy-Kurs umfasst insgesamt 5 Lektionen.
Grundlagen der Textvorverarbeitung
Tokenisierung und Normalisierung
Die Textvorverarbeitung ist ein entscheidender Schritt in NLP. Dabei wird Rohtext für die Analyse in ein strukturiertes Format überführt. Zu den wichtigsten Schritten der Vorverarbeitung gehören Tokenisierung und Normalisierung.

Was ist Tokenisierung?
Was ist Tokenisierung?
Tokenisierung bezeichnet das Aufteilen von Text in kleinere Einheiten, die Tokens genannt werden. Tokens können Wörter, Sätze oder Zeichen sein.
Zum Beispiel:
Text: "NLP is amazing!"
Tokens: ["NLP", "is", "amazing", "!"]
Beispiel für Tokenisierung in Python
Beispiel für Tokenisierung in Python
Mit der NLTK-Bibliothek können wir Text in Wörter oder Sätze tokenisieren:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)Was ist Normalisierung?
Was ist Normalisierung?
Bei der Normalisierung wird Text bereinigt und vereinheitlicht. Zu den üblichen Normalisierungstechniken gehören:
- Kleinschreibung: Umwandeln des gesamten Textes in Kleinbuchstaben.
- Entfernen von Satzzeichen: Beseitigen von Satzzeichen.
- Stemming: Reduzieren von Wörtern auf ihre Stammform (z. B. "running" → "run").
- Lemmatisierung: Reduzieren von Wörtern anhand des Kontexts auf ihre Grundform (z. B. "better" → "good").
Kleinschreibung und Entfernen von Satzzeichen
Kleinschreibung und Entfernen von Satzzeichen
So normalisieren Sie Text, indem Sie ihn in Kleinbuchstaben umwandeln und Satzzeichen entfernen:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)Stemming und Lemmatisierung
Stemming und Lemmatisierung
Stemming: Reduziert Wörter, indem Endungen abgeschnitten werden, auf ihre Stammform. Es basiert auf Regeln und erzeugt daher nicht immer gültige Wörter.
Lemmatisierung: Verwendet ein Vokabular und Grammatikregeln, um Wörter auf ihre bedeutungstragende Grundform zu reduzieren.
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))Entfernen von Stoppwörtern
Entfernen von Stoppwörtern
Stoppwörter sind häufig verwendete Wörter (z. B. "is", "and", "the"), die oft keine wesentliche Bedeutung tragen. Durch das Entfernen dieser Wörter lässt sich die Textanalyse vereinfachen:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)Herausforderungen bei der Textvorverarbeitung
Herausforderungen bei der Textvorverarbeitung
Die Textvorverarbeitung kann aus folgenden Gründen eine Herausforderung darstellen:
- Mehrdeutigkeit: Wörter wie "lead" können mehrere Bedeutungen haben.
- Kontext: Für die Lemmatisierung muss der Kontext des Wortes verstanden werden.
- Sprachliche Vielfalt: Umgang mit verschiedenen Sprachen und Dialekten.
Zusammenfassung und nächste Schritte
Zusammenfassung und nächste Schritte
In dieser Lektion haben wir:
- Tokenisierung und Normalisierung kennengelernt.
- Techniken wie Stemming, Lemmatisierung und das Entfernen von Stoppwörtern erkundet.
- Textvorverarbeitung mit Python geübt.
Als Nächstes analysieren wir Textmuster mithilfe von N-Gramm-Modellen.

Häufig gestellte Fragen
Ist die Lektion „Tokenisierung und Normalisierung“ kostenlos?
Ja — der vollständige Text von „Tokenisierung und Normalisierung“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Python Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Python Academy-Kurs umfasst insgesamt 5 Lektionen.
Was lerne ich in „Tokenisierung und Normalisierung“?
Techniken zur Textvorverarbeitung Du übst Python Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um Python Academy zu starten?
Keine Vorkenntnisse erforderlich. Python Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 5.
Wie lange dauert die Lektion „Tokenisierung und Normalisierung“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser Python Academy-Lektion Code schreiben und ausführen?
Ja. Jede Python Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Arbeiten mit Textdaten
- Tokenisierung und Normalisierung
- N-Gramm-Modelle
- Konzepte der Sentimentanalyse
- Transformer-basierte Modelle