Tokeniser pour les modèles Transformer
Sous-mots, remplissage et masques d’attention
Tokeniser pour les modèles Transformer est une leçon NLP Academy gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage NLP Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours NLP Academy comprend 4 leçons au total.
Les tokens d’abord
Avant qu’un transformeur puisse apprendre quoi que ce soit, votre texte doit devenir des nombres. Cette conversion relève du tokenizer.
Associer le bon modèle
Chargez toujours le tokenizer qui a été entraîné avec votre modèle. Un vocabulaire incompatible produit des identifiants incohérents que le modèle n’a jamais vus.
from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("bert-base-uncased")Fragments de sous-mots
Les tokenizers modernes découpent les mots rares en fragments plus petits appelés sous-mots, afin que même un texte inconnu puisse être représenté.
print(tok.tokenize("tokenization"))Pourquoi les sous-mots sont efficaces
Les sous-mots gardent un vocabulaire réduit tout en gérant les fautes de frappe et les mots nouveaux. Le modèle rencontre rarement un véritable token inconnu.
Des tokens aux identifiants
Chaque sous-mot correspond à un identifiant entier. Appeler le tokenizer sur un texte renvoie ces identifiants, prêts pour le modèle.
enc = tok("Fine-tuning is fun")
print(enc["input_ids"])Tokens spéciaux
Les tokenizers ajoutent des marqueurs comme CLS et SEP afin que le modèle sache où une séquence commence et se termine. Ce sont les tokens spéciaux.
Rembourser jusqu’à la même longueur
Les lots doivent avoir des lignes de même longueur, alors les textes plus courts reçoivent des tokens de remplissage. Cette étape s’appelle le remplissage.
tok(texts, padding=True)Tronquer les textes longs
Les modèles limitent la longueur des entrées, donc les textes très longs sont coupés pour tenir dans cette limite. Activer la troncature maintient chaque exemple dans les limites autorisées.
tok(texts, truncation=True, max_length=128)Le masque d’attention
Un masque d’attention marque les vrais tokens par 1 et le remplissage par 0, afin que le modèle ignore les positions de remplissage.
print(enc["attention_mask"])Renvoyer des tenseurs
Demandez directement au tokenizer des tenseurs compatibles avec votre environnement afin que la sortie puisse être utilisée immédiatement pour l’entraînement, sans conversion supplémentaire.
tok("hello", return_tensors="pt")Reconvertir en texte
Pour lire les prédictions, transmettez les identifiants à decode, et le tokenizer reconstruit le texte d’origine en supprimant les tokens spéciaux.
print(tok.decode(enc["input_ids"]))Vérification rapide
Quel est le rôle du masque d’attention pendant la formation des lots ?
Récapitulatif
Les tokenizers transforment le texte en identifiants de sous-mots, ajoutent les tokens spéciaux, puis gèrent le remplissage, la troncature et le masque d’attention pour créer des lots propres. ✅
Apprends Python avec un tuteur IA — gratuit
Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.
- Cours
- 30
- Leçons
- 120
Questions Fréquemment Posées
La leçon « Tokeniser pour les modèles Transformer » est-elle gratuite ?
Oui — le texte complet de « Tokeniser pour les modèles Transformer » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours NLP Academy, passe à CoddyKit PRO. Le cours NLP Academy comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Tokeniser pour les modèles Transformer » ?
Sous-mots, remplissage et masques d’attention Tu pratiques NLP Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer NLP Academy ?
Aucune expérience préalable n'est requise. NLP Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.
Combien de temps prend la leçon « Tokeniser pour les modèles Transformer » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon NLP Academy ?
Oui. Chaque leçon NLP Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Visite de la bibliothèque Transformers
- Tokeniser pour les modèles Transformer
- Affiner un modèle avec l’API Trainer
- Évaluer et enregistrer votre modèle