Attention multi-têtes et positions
De multiples points de vue et la prise en compte de l’ordre
Attention multi-têtes et positions est une leçon NLP Academy gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage NLP Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours NLP Academy comprend 4 leçons au total.
Un seul mécanisme d’attention est limité
Une seule tête d’attention ne peut suivre qu’un seul type de relation à la fois. La langue réelle exige de repérer de nombreux schémas simultanément. 🧠
De nombreuses têtes, de nombreux points de vue
L’attention multi-tête exécute plusieurs calculs d’attention en parallèle, chacun avec ses propres projections apprises et son propre centre d’intérêt.
Ce que chaque tête apprend
Une tête peut suivre les liens sujet-verbe, tandis qu’une autre suit les pronoms. Ensemble, elles saisissent une représentation bien plus riche de la phrase.
Répartir les dimensions
Le modèle répartit la taille de son vecteur entre les têtes, de sorte que chaque tête travaille dans un sous-espace plus petit. Le coût total des calculs reste à peu près le même.
d_head = d_model // num_headsCombiner les têtes
Après que chaque tête a produit une sortie, vous les concaténez, puis transmettez le résultat à une couche linéaire supplémentaire pour mélanger les différents points de vue.
out = concat(head_1, head_2, ...) @ W_oL’attention ignore l’ordre
L’auto-attention traite l’entrée comme un ensemble ; à elle seule, elle ne peut donc pas distinguer « dog bites man » de « man bites dog ». Elle est insensible à l’ordre.
Ajouter l’information de position
Pour corriger cela, nous injectons un codage positionnel dans chaque mot afin que le modèle sache où se trouve chaque unité dans la séquence.
Codages sinusoïdaux
Le transformeur d’origine utilise des ondes fixes de sinus et de cosinus à différentes fréquences pour donner à chaque position une signature unique et régulière.
pe[pos, 2i] = sin(pos / 10000 ** (2*i/d))Ajouter, et non concaténer
Les vecteurs de position sont ajoutés aux représentations vectorielles des mots, et non placés à la fin. Chaque unité porte donc à la fois son sens et sa position.
x = token_embeddings + positional_encodingDes positions apprises également
De nombreux modèles modernes remplacent les ondes fixes par des représentations vectorielles de position apprises, entraînées avec le reste du modèle pour plus de flexibilité.
Pourquoi les deux sont importantes
L’attention multi-tête repère de nombreuses relations ; les codages positionnels rétablissent l’ordre. Ensemble, ils permettent au transformeur de réellement comprendre les séquences. ✨
Vérification rapide
Testons les positions et les têtes.
Récapitulatif
Vous avez vu comment l’attention multi-tête capture de nombreuses relations en parallèle, tandis que les codages positionnels donnent au modèle une notion de l’ordre. 🎯
Apprends Python avec un tuteur IA — gratuit
Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.
- Cours
- 30
- Leçons
- 120
Questions Fréquemment Posées
La leçon « Attention multi-têtes et positions » est-elle gratuite ?
Oui — le texte complet de « Attention multi-têtes et positions » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours NLP Academy, passe à CoddyKit PRO. Le cours NLP Academy comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Attention multi-têtes et positions » ?
De multiples points de vue et la prise en compte de l’ordre Tu pratiques NLP Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer NLP Academy ?
Aucune expérience préalable n'est requise. NLP Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.
Combien de temps prend la leçon « Attention multi-têtes et positions » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon NLP Academy ?
Oui. Chaque leçon NLP Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- L’idée de l’attention
- L’auto-attention, étape par étape
- Attention multi-têtes et positions
- À l’intérieur du bloc Transformer