Plongements GloVe et FastText
Statistiques globales de cooccurrence, sous-mots avec FastText, chargement de plongements préentraînés.
Plongements GloVe et FastText est une leçon Learn AI with Python gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Learn AI with Python, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Learn AI with Python comprend 4 leçons au total.
Au-delà de Word2Vec
Word2Vec apprend à partir de fenêtres de contexte locales. Deux autres représentations vectorielles influentes adoptent des approches différentes : GloVe utilise des statistiques globales et FastText utilise des segments de caractères.
Qu'est-ce que GloVe
GloVe (Global Vectors) est entraîné sur une matrice de cooccurrence globale : le nombre de fois où chaque paire de mots apparaît ensemble dans l'ensemble du corpus, et pas seulement dans des fenêtres locales.
Pourquoi les statistiques globales sont utiles
En factorisant la matrice de cooccurrence complète, GloVe capture les relations et les rapports entre les mots à l'échelle du corpus. Il produit souvent des vecteurs de grande qualité, qui rivalisent avec Word2Vec ou le surpassent dans les tâches d'analogie.
Charger des vecteurs préentraînés
L'entraînement de représentations vectorielles nécessite d'immenses corpus ; nous téléchargeons donc généralement des représentations préentraînées. gensim.downloader récupère en une ligne des modèles populaires, comme les vecteurs GloVe.
import gensim.downloader as api
glove = api.load("glove-wiki-gigaword-100")
print(glove["computer"].shape) # (100,)Utiliser GloVe préentraîné
Une fois chargés, les vecteurs GloVe prennent en charge les mêmes opérations que ceux de Word2Vec : la similarité et les analogies.
import gensim.downloader as api
glove = api.load("glove-wiki-gigaword-100")
print(glove.most_similar("king", topn=3))
print(glove.most_similar(positive=["king", "woman"], negative=["man"], topn=1))Le problème des mots hors vocabulaire
Word2Vec et GloVe attribuent des vecteurs uniquement aux mots vus pendant l'entraînement. Un mot nouveau ou mal orthographié (hors vocabulaire, OOV) n'a aucun vecteur, ce qui constitue une véritable limite pour les textes désordonnés.
Qu'est-ce que FastText
FastText résout le problème OOV en représentant chaque mot comme un sac de n-grammes de caractères. Le mot « jouant » comprend des segments comme « jou », « oua » et « ant », et partage ainsi une structure avec les mots apparentés.
Comment les n-grammes de caractères sont utiles
Comme le vecteur d'un mot est construit à partir de ses sous-segments, FastText peut construire le vecteur d'un mot jamais vu à partir de ses n-grammes. Il capture également la morphologie, ce qui aide à gérer les préfixes, les suffixes et les mots rares.
Entraîner FastText
gensim fournit FastText avec une interface similaire à celle de Word2Vec. Les paramètres min_n et max_n définissent la plage des n-grammes de caractères.
from gensim.models import FastText
model = FastText(
sentences,
vector_size=100,
window=5,
min_count=1,
min_n=3,
max_n=6,
)FastText gère les mots hors vocabulaire
Même un mot jamais vu pendant l'entraînement renvoie un vecteur, assemblé à partir de ses n-grammes de caractères. C'est l'avantage caractéristique de FastText par rapport à Word2Vec et GloVe.
from gensim.models import FastText
model = FastText(sentences, vector_size=100, min_n=3, max_n=6, min_count=1)
# works even if "catlike" was never in training
vec = model.wv["catlike"]Choisir une représentation vectorielle
Utilisez GloVe ou Word2Vec pour des textes propres avec un vocabulaire fixe. Choisissez FastText pour les langues à morphologie riche, les textes bruités ou lorsque les mots OOV sont fréquents. Dans tous les cas, les vecteurs préentraînés constituent un excellent point de départ.
Vérification rapide
Évaluez vos connaissances sur les représentations vectorielles.
Récapitulatif
Récapitulatif : GloVe apprend à partir de statistiques globales de cooccurrence ; FastText utilise des n-grammes de caractères pour gérer les mots hors vocabulaire et la morphologie. Chargez les vecteurs préentraînés avec gensim.downloader.load. Les deux prennent en charge la similarité et les analogies. Choisissez FastText pour les textes bruités ou à morphologie riche, et GloVe/Word2Vec pour les vocabulaires propres et fixes.
Questions Fréquemment Posées
La leçon « Plongements GloVe et FastText » est-elle gratuite ?
Oui — le texte complet de « Plongements GloVe et FastText » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Learn AI with Python, passe à CoddyKit PRO. Le cours Learn AI with Python comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Plongements GloVe et FastText » ?
Statistiques globales de cooccurrence, sous-mots avec FastText, chargement de plongements préentraînés. Tu pratiques Learn AI with Python avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer Learn AI with Python ?
Aucune expérience préalable n'est requise. Learn AI with Python sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.
Combien de temps prend la leçon « Plongements GloVe et FastText » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon Learn AI with Python ?
Oui. Chaque leçon Learn AI with Python inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Word2Vec : Skip-gram et CBOW
- Plongements GloVe et FastText
- Classification de texte avec BERT
- Similarité sémantique et plongements de phrases