NLP Academy · Leçon

Tokeniser pour les modèles Transformer

Sous-mots, remplissage et masques d’attention

Leçon 2 sur 413 étapes

Tokeniser pour les modèles Transformer est une leçon NLP Academy gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage NLP Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours NLP Academy comprend 4 leçons au total.

Les tokens d’abord

Avant qu’un transformeur puisse apprendre quoi que ce soit, votre texte doit devenir des nombres. Cette conversion relève du tokenizer.

Associer le bon modèle

Chargez toujours le tokenizer qui a été entraîné avec votre modèle. Un vocabulaire incompatible produit des identifiants incohérents que le modèle n’a jamais vus.

from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("bert-base-uncased")

Fragments de sous-mots

Les tokenizers modernes découpent les mots rares en fragments plus petits appelés sous-mots, afin que même un texte inconnu puisse être représenté.

print(tok.tokenize("tokenization"))

Pourquoi les sous-mots sont efficaces

Les sous-mots gardent un vocabulaire réduit tout en gérant les fautes de frappe et les mots nouveaux. Le modèle rencontre rarement un véritable token inconnu.

Des tokens aux identifiants

Chaque sous-mot correspond à un identifiant entier. Appeler le tokenizer sur un texte renvoie ces identifiants, prêts pour le modèle.

enc = tok("Fine-tuning is fun")
print(enc["input_ids"])

Tokens spéciaux

Les tokenizers ajoutent des marqueurs comme CLS et SEP afin que le modèle sache où une séquence commence et se termine. Ce sont les tokens spéciaux.

Rembourser jusqu’à la même longueur

Les lots doivent avoir des lignes de même longueur, alors les textes plus courts reçoivent des tokens de remplissage. Cette étape s’appelle le remplissage.

tok(texts, padding=True)

Tronquer les textes longs

Les modèles limitent la longueur des entrées, donc les textes très longs sont coupés pour tenir dans cette limite. Activer la troncature maintient chaque exemple dans les limites autorisées.

tok(texts, truncation=True, max_length=128)

Le masque d’attention

Un masque d’attention marque les vrais tokens par 1 et le remplissage par 0, afin que le modèle ignore les positions de remplissage.

print(enc["attention_mask"])

Renvoyer des tenseurs

Demandez directement au tokenizer des tenseurs compatibles avec votre environnement afin que la sortie puisse être utilisée immédiatement pour l’entraînement, sans conversion supplémentaire.

tok("hello", return_tensors="pt")

Reconvertir en texte

Pour lire les prédictions, transmettez les identifiants à decode, et le tokenizer reconstruit le texte d’origine en supprimant les tokens spéciaux.

print(tok.decode(enc["input_ids"]))

Vérification rapide

Quel est le rôle du masque d’attention pendant la formation des lots ?

Récapitulatif

Les tokenizers transforment le texte en identifiants de sous-mots, ajoutent les tokens spéciaux, puis gèrent le remplissage, la troncature et le masque d’attention pour créer des lots propres. ✅

Gratuit pour commencer

Apprends Python avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
30
Leçons
120

Questions Fréquemment Posées

La leçon « Tokeniser pour les modèles Transformer » est-elle gratuite ?

Oui — le texte complet de « Tokeniser pour les modèles Transformer » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours NLP Academy, passe à CoddyKit PRO. Le cours NLP Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Tokeniser pour les modèles Transformer » ?

Sous-mots, remplissage et masques d’attention Tu pratiques NLP Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer NLP Academy ?

Aucune expérience préalable n'est requise. NLP Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.

Combien de temps prend la leçon « Tokeniser pour les modèles Transformer » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon NLP Academy ?

Oui. Chaque leçon NLP Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Visite de la bibliothèque Transformers
  2. Tokeniser pour les modèles Transformer
  3. Affiner un modèle avec l’API Trainer
  4. Évaluer et enregistrer votre modèle
← Retour à NLP Academy