Tokeniser et construire un vocabulaire
Associez le texte à des identifiants entiers.
Tokeniser et construire un vocabulaire est une leçon Deep Learning Academy gratuite sur CoddyKit. Ceci est la leçon 1 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Deep Learning Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Deep Learning Academy comprend 4 leçons au total.
Les réseaux ne traitent que des nombres
Un réseau neuronal ne peut pas lire des lettres brutes. Avant tout apprentissage, vous devez transformer le texte en nombres que le modèle peut traiter. 🔢
Première étape : tokeniser
Tokeniser signifie découper le texte en petites unités appelées jetons. Le choix le plus simple consiste à découper une phrase sur les espaces pour obtenir des mots.
text = "I love deep learning"
tokens = text.split()
# ["I", "love", "deep", "learning"]Les jetons peuvent être plus petits
Un jeton ne doit pas forcément être un mot entier. Il peut s'agir d'un caractère ou d'un fragment de mot, ce qui aide le modèle à gérer les mots rares ou inconnus.
Construire un vocabulaire
Un vocabulaire est l'ensemble complet des jetons uniques connus par votre modèle. Vous rassemblez chaque jeton distinct présent dans vos textes d'entraînement.
Attribuer un identifiant à chaque jeton
Chaque jeton unique reçoit un identifiant entier. Cette correspondance entre jeton et identifiant permet au réseau d'indexer les mots sous forme de nombres.
vocab = {"i": 0, "love": 1, "deep": 2, "learning": 3}Encoder une phrase
Pour encoder un texte, recherchez chaque jeton dans le vocabulaire et remplacez-le par son identifiant afin de produire une liste d'entiers.
ids = [vocab[t] for t in ["i", "love", "deep"]]
# [0, 1, 2]Gérer les mots inconnus
Certains jetons présents lors des tests n'ont jamais été vus pendant l'entraînement. Associez-les à un jeton spécial inconnu afin que le modèle reçoive tout de même un identifiant valide.
unk_id = vocab.get("dragons", vocab["<unk>"])Les jetons spéciaux sont utiles
Ajoutez des jetons spéciaux comme des marqueurs de remplissage, de début et de fin. Ils apportent au modèle une structure qui dépasse les simples mots.
Mettre en minuscules et nettoyer
Normaliser le texte en le mettant en minuscules et en supprimant la ponctuation réduit la taille du vocabulaire : Cat et cat partagent ainsi un seul identifiant.
Limiter la taille du vocabulaire
Les corpus réels possèdent d'immenses vocabulaires. Conservez uniquement les jetons les plus fréquents pour contrôler la taille du vocabulaire ; les autres deviennent inconnus.
Le texte est maintenant un tenseur
Une fois encodée, une phrase est une liste d'identifiants que vous pouvez placer dans un tensor. Le pipeline allant du texte brut à l'entrée du modèle est terminé.
import torch
ids = torch.tensor([0, 1, 2, 3])Vérification rapide
Que fournit la construction d'un vocabulaire à chaque jeton unique ?
Récapitulatif
Vous découpez le texte en jetons, rassemblez les jetons uniques dans un vocabulaire, puis associez chacun à un identifiant entier pour transformer le texte en nombres. ✅
Apprends Python avec un tuteur IA — gratuit
Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.
- Cours
- 30
- Leçons
- 120
Questions Fréquemment Posées
La leçon « Tokeniser et construire un vocabulaire » est-elle gratuite ?
Oui — le texte complet de « Tokeniser et construire un vocabulaire » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Deep Learning Academy, passe à CoddyKit PRO. Le cours Deep Learning Academy comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Tokeniser et construire un vocabulaire » ?
Associez le texte à des identifiants entiers. Tu pratiques Deep Learning Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer Deep Learning Academy ?
Aucune expérience préalable n'est requise. Deep Learning Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 1 sur 4.
Combien de temps prend la leçon « Tokeniser et construire un vocabulaire » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon Deep Learning Academy ?
Oui. Chaque leçon Deep Learning Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Tokeniser et construire un vocabulaire
- nn.Embedding : vecteurs de mots apprenables
- Pourquoi les plongements capturent le sens
- Entraîner un classificateur de texte