0Pricing
Learn AI with Python · Lektion

GloVe- und FastText-Embeddings

Globale Kookkurrenzstatistiken, FastText mit Subwords, Laden vortrainierter Embeddings.

GloVe- und FastText-Embeddings ist eine kostenlose Learn AI with Python-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Learn AI with Python-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Über Word2Vec hinaus

Word2Vec lernt aus lokalen Kontextfenstern. Zwei weitere einflussreiche Einbettungsverfahren verfolgen andere Ansätze: GloVe verwendet globale Statistiken und FastText verwendet Zeichenbestandteile.

Was ist GloVe

GloVe (Global Vectors) wird anhand einer globalen Kookkurrenzmatrix trainiert: Sie erfasst, wie oft jedes Wortpaar im gesamten Korpus gemeinsam vorkommt, nicht nur in lokalen Kontextfenstern.

Warum globale Statistiken helfen

Durch die Faktorisierung der vollständigen Kookkurrenzmatrix erfasst GloVe Beziehungen und Verhältnisse zwischen Wörtern im gesamten Korpus. Dadurch entstehen häufig hochwertige Vektoren, die bei Analogieaufgaben mit Word2Vec mithalten oder es übertreffen.

Vortrainierte Vektoren laden

Das Training von Einbettungen benötigt riesige Korpora, daher laden wir normalerweise vortrainierte Modelle herunter. gensim.downloader ruft beliebte Modelle wie GloVe-Vektoren mit einer einzigen Zeile ab.

import gensim.downloader as api

glove = api.load("glove-wiki-gigaword-100")
print(glove["computer"].shape)   # (100,)

Vortrainiertes GloVe verwenden

Nach dem Laden unterstützen GloVe-Vektoren dieselben Operationen wie Word2Vec: Ähnlichkeitssuchen und Analogien.

import gensim.downloader as api

glove = api.load("glove-wiki-gigaword-100")
print(glove.most_similar("king", topn=3))
print(glove.most_similar(positive=["king", "woman"], negative=["man"], topn=1))

Das Out-of-Vocabulary-Problem

Word2Vec und GloVe weisen nur Wörtern Vektoren zu, die im Training vorkamen. Ein neues oder falsch geschriebenes Wort (out-of-vocabulary, OOV) hat keinen Vektor – eine echte Einschränkung bei unstrukturiertem Text.

Was ist FastText

FastText löst das OOV-Problem, indem es jedes Wort als Menge von Zeichen-N-Grammen darstellt. Das Wort "playing" enthält Bestandteile wie "pla", "lay" und "ing" und teilt dadurch seine Struktur mit verwandten Wörtern.

Wie Zeichen-N-Gramme helfen

Da ein Wortvektor aus seinen Teilbestandteilen gebildet wird, kann FastText aus den N-Grammen einen Vektor für ein nicht im Training gesehenes Wort erstellen. Außerdem erfasst es Morphologie und hilft so bei Präfixen, Suffixen und seltenen Wörtern.

FastText trainieren

gensim stellt FastText mit einer API ähnlich der von Word2Vec bereit. Die Parameter min_n und max_n legen den Bereich der Zeichen-N-Gramme fest.

from gensim.models import FastText

model = FastText(
    sentences,
    vector_size=100,
    window=5,
    min_count=1,
    min_n=3,
    max_n=6,
)

FastText verarbeitet OOV-Wörter

Selbst ein Wort, das im Training nie vorkam, liefert einen Vektor, der aus seinen Zeichen-N-Grammen zusammengesetzt wird. Das ist die besondere Stärke von FastText gegenüber Word2Vec und GloVe.

from gensim.models import FastText

model = FastText(sentences, vector_size=100, min_n=3, max_n=6, min_count=1)
# works even if "catlike" was never in training
vec = model.wv["catlike"]

Eine Einbettung auswählen

Verwenden Sie GloVe oder Word2Vec für sauberen Text mit einem festen Vokabular. Wählen Sie FastText für morphologisch reichhaltige Sprachen, verrauschten Text oder wenn OOV-Wörter häufig vorkommen. Vortrainierte Vektoren sind in allen Fällen ein guter Ausgangspunkt.

Schnelltest

Testen Sie Ihr Wissen über Einbettungen.

Zusammenfassung

Zusammenfassung: GloVe lernt aus globalen Kookkurrenzstatistiken; FastText verwendet Zeichen-N-Gramme, um mit Wörtern außerhalb des Vokabulars und Morphologie umzugehen. Laden Sie vortrainierte Vektoren mit gensim.downloader.load. Beide Verfahren unterstützen Ähnlichkeitssuchen und Analogien. Wählen Sie FastText für verrauschten oder morphologisch reichhaltigen Text und GloVe/Word2Vec für saubere Vokabulare mit fester Größe.

Häufig gestellte Fragen

Ist die Lektion „GloVe- und FastText-Embeddings“ kostenlos?

Ja — der vollständige Text von „GloVe- und FastText-Embeddings“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Learn AI with Python-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „GloVe- und FastText-Embeddings“?

Globale Kookkurrenzstatistiken, FastText mit Subwords, Laden vortrainierter Embeddings. Du übst Learn AI with Python mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Learn AI with Python zu starten?

Keine Vorkenntnisse erforderlich. Learn AI with Python auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.

Wie lange dauert die Lektion „GloVe- und FastText-Embeddings“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Learn AI with Python-Lektion Code schreiben und ausführen?

Ja. Jede Learn AI with Python-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Word2Vec: Skip-gram und CBOW
  2. GloVe- und FastText-Embeddings
  3. Textklassifikation mit BERT
  4. Semantische Ähnlichkeit und Satz-Embeddings
← Zurück zu Learn AI with Python