0Pricing
Learn AI with Python · Lektion

Tokenisierung und Normalisierung

Techniken zur Textvorverarbeitung

Tokenisierung und Normalisierung ist eine kostenlose Learn AI with Python-Lektion auf CoddyKit. Dies ist Lektion 2 von 5. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Learn AI with Python-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Learn AI with Python-Kurs umfasst insgesamt 5 Lektionen.

Grundlagen der Textvorverarbeitung

Tokenisierung und Normalisierung

Textvorverarbeitung ist ein entscheidender Schritt im NLP. Dabei wird Rohtext für die Analyse in ein strukturiertes Format umgewandelt. Zu den wichtigsten Schritten der Vorverarbeitung gehören Tokenisierung und Normalisierung.

Tokenisierung und Normalisierung — Illustration 1

Was ist Tokenisierung?

Was ist Tokenisierung?

Tokenisierung bezeichnet den Prozess, Text in kleinere Einheiten, sogenannte Tokens, zu zerlegen. Tokens können Wörter, Sätze oder Zeichen sein.

Beispiel:

Text: "NLP is amazing!"

Tokens: ["NLP", "is", "amazing", "!"]

Beispiel für Tokenisierung in Python

Beispiel für Tokenisierung in Python

Mit der NLTK-Bibliothek können wir Text in Wörter oder Sätze tokenisieren:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

Was ist Normalisierung?

Was ist Normalisierung?

Bei der Normalisierung wird Text bereinigt und vereinheitlicht. Zu den gängigen Normalisierungstechniken gehören:

  • Umwandlung in Kleinbuchstaben: Den gesamten Text in Kleinbuchstaben umwandeln.
  • Entfernen von Satzzeichen: Satzzeichen beseitigen.
  • Stemming: Wörter auf ihre Grundform reduzieren (z. B. „laufend“ → „lauf“).
  • Lemmatization: Wörter mithilfe des Kontexts auf ihre lexikalische Grundform reduzieren (z. B. „besser“ → „gut“).

Kleinschreibung und Entfernen von Satzzeichen

Kleinschreibung und Entfernen von Satzzeichen

So normalisieren Sie Text, indem Sie ihn in Kleinbuchstaben umwandeln und Satzzeichen entfernen:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

Stemming und Lemmatization

Stemming und Lemmatization

Stemming: Reduziert Wörter, indem Endungen abgeschnitten werden, auf ihre Wortwurzel. Dieses Verfahren basiert auf Regeln und erzeugt möglicherweise nicht immer gültige Wörter.

Lemmatization: Verwendet ein Vokabular und grammatische Regeln, um Wörter auf ihre bedeutungstragende Grundform zu reduzieren.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

Entfernen von Stoppwörtern

Entfernen von Stoppwörtern

Stoppwörter sind häufig vorkommende Wörter (z. B. „ist“, „und“, „der“), die oft keine wesentliche Bedeutung tragen. Durch das Entfernen dieser Wörter lässt sich die Textanalyse vereinfachen:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

Herausforderungen bei der Textvorverarbeitung

Herausforderungen bei der Textvorverarbeitung

Die Textvorverarbeitung kann aus folgenden Gründen anspruchsvoll sein:

  • Mehrdeutigkeit: Wörter wie „Bank“ können mehrere Bedeutungen haben.
  • Kontext: Für die Lemmatization muss der Kontext des Wortes verstanden werden.
  • Sprachliche Vielfalt: Verschiedene Sprachen und Dialekte müssen verarbeitet werden.

Zusammenfassung und nächste Schritte

Zusammenfassung und nächste Schritte

In dieser Lektion haben wir:

  • Tokenisierung und Normalisierung kennengelernt.
  • Techniken wie Stemming, Lemmatisierung und das Entfernen von Stoppwörtern untersucht.
  • Textvorverarbeitung mit Python geübt.

Als Nächstes analysieren wir Textmuster mithilfe von N-Gramm-Modellen.

Tokenisierung und Normalisierung — Illustration 10

Häufig gestellte Fragen

Ist die Lektion „Tokenisierung und Normalisierung“ kostenlos?

Ja — der vollständige Text von „Tokenisierung und Normalisierung“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Learn AI with Python-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Learn AI with Python-Kurs umfasst insgesamt 5 Lektionen.

Was lerne ich in „Tokenisierung und Normalisierung“?

Techniken zur Textvorverarbeitung Du übst Learn AI with Python mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Learn AI with Python zu starten?

Keine Vorkenntnisse erforderlich. Learn AI with Python auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 5.

Wie lange dauert die Lektion „Tokenisierung und Normalisierung“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Learn AI with Python-Lektion Code schreiben und ausführen?

Ja. Jede Learn AI with Python-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Arbeiten mit Textdaten
  2. Tokenisierung und Normalisierung
  3. N-Gramm-Modelle
  4. Konzepte der Sentimentanalyse
  5. Transformer-basierte Modelle
← Zurück zu Learn AI with Python