GloVe- und FastText-Embeddings
Globale Kookkurrenzstatistiken, FastText mit Subwords, Laden vortrainierter Embeddings.
GloVe- und FastText-Embeddings ist eine kostenlose Learn AI with Python-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Learn AI with Python-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.
Über Word2Vec hinaus
Word2Vec lernt aus lokalen Kontextfenstern. Zwei weitere einflussreiche Einbettungsverfahren verfolgen andere Ansätze: GloVe verwendet globale Statistiken und FastText verwendet Zeichenbestandteile.
Was ist GloVe
GloVe (Global Vectors) wird anhand einer globalen Kookkurrenzmatrix trainiert: Sie erfasst, wie oft jedes Wortpaar im gesamten Korpus gemeinsam vorkommt, nicht nur in lokalen Kontextfenstern.
Warum globale Statistiken helfen
Durch die Faktorisierung der vollständigen Kookkurrenzmatrix erfasst GloVe Beziehungen und Verhältnisse zwischen Wörtern im gesamten Korpus. Dadurch entstehen häufig hochwertige Vektoren, die bei Analogieaufgaben mit Word2Vec mithalten oder es übertreffen.
Vortrainierte Vektoren laden
Das Training von Einbettungen benötigt riesige Korpora, daher laden wir normalerweise vortrainierte Modelle herunter. gensim.downloader ruft beliebte Modelle wie GloVe-Vektoren mit einer einzigen Zeile ab.
import gensim.downloader as api
glove = api.load("glove-wiki-gigaword-100")
print(glove["computer"].shape) # (100,)Vortrainiertes GloVe verwenden
Nach dem Laden unterstützen GloVe-Vektoren dieselben Operationen wie Word2Vec: Ähnlichkeitssuchen und Analogien.
import gensim.downloader as api
glove = api.load("glove-wiki-gigaword-100")
print(glove.most_similar("king", topn=3))
print(glove.most_similar(positive=["king", "woman"], negative=["man"], topn=1))Das Out-of-Vocabulary-Problem
Word2Vec und GloVe weisen nur Wörtern Vektoren zu, die im Training vorkamen. Ein neues oder falsch geschriebenes Wort (out-of-vocabulary, OOV) hat keinen Vektor – eine echte Einschränkung bei unstrukturiertem Text.
Was ist FastText
FastText löst das OOV-Problem, indem es jedes Wort als Menge von Zeichen-N-Grammen darstellt. Das Wort "playing" enthält Bestandteile wie "pla", "lay" und "ing" und teilt dadurch seine Struktur mit verwandten Wörtern.
Wie Zeichen-N-Gramme helfen
Da ein Wortvektor aus seinen Teilbestandteilen gebildet wird, kann FastText aus den N-Grammen einen Vektor für ein nicht im Training gesehenes Wort erstellen. Außerdem erfasst es Morphologie und hilft so bei Präfixen, Suffixen und seltenen Wörtern.
FastText trainieren
gensim stellt FastText mit einer API ähnlich der von Word2Vec bereit. Die Parameter min_n und max_n legen den Bereich der Zeichen-N-Gramme fest.
from gensim.models import FastText
model = FastText(
sentences,
vector_size=100,
window=5,
min_count=1,
min_n=3,
max_n=6,
)FastText verarbeitet OOV-Wörter
Selbst ein Wort, das im Training nie vorkam, liefert einen Vektor, der aus seinen Zeichen-N-Grammen zusammengesetzt wird. Das ist die besondere Stärke von FastText gegenüber Word2Vec und GloVe.
from gensim.models import FastText
model = FastText(sentences, vector_size=100, min_n=3, max_n=6, min_count=1)
# works even if "catlike" was never in training
vec = model.wv["catlike"]Eine Einbettung auswählen
Verwenden Sie GloVe oder Word2Vec für sauberen Text mit einem festen Vokabular. Wählen Sie FastText für morphologisch reichhaltige Sprachen, verrauschten Text oder wenn OOV-Wörter häufig vorkommen. Vortrainierte Vektoren sind in allen Fällen ein guter Ausgangspunkt.
Schnelltest
Testen Sie Ihr Wissen über Einbettungen.
Zusammenfassung
Zusammenfassung: GloVe lernt aus globalen Kookkurrenzstatistiken; FastText verwendet Zeichen-N-Gramme, um mit Wörtern außerhalb des Vokabulars und Morphologie umzugehen. Laden Sie vortrainierte Vektoren mit gensim.downloader.load. Beide Verfahren unterstützen Ähnlichkeitssuchen und Analogien. Wählen Sie FastText für verrauschten oder morphologisch reichhaltigen Text und GloVe/Word2Vec für saubere Vokabulare mit fester Größe.
Häufig gestellte Fragen
Ist die Lektion „GloVe- und FastText-Embeddings“ kostenlos?
Ja — der vollständige Text von „GloVe- und FastText-Embeddings“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Learn AI with Python-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „GloVe- und FastText-Embeddings“?
Globale Kookkurrenzstatistiken, FastText mit Subwords, Laden vortrainierter Embeddings. Du übst Learn AI with Python mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um Learn AI with Python zu starten?
Keine Vorkenntnisse erforderlich. Learn AI with Python auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.
Wie lange dauert die Lektion „GloVe- und FastText-Embeddings“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser Learn AI with Python-Lektion Code schreiben und ausführen?
Ja. Jede Learn AI with Python-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Word2Vec: Skip-gram und CBOW
- GloVe- und FastText-Embeddings
- Textklassifikation mit BERT
- Semantische Ähnlichkeit und Satz-Embeddings