NLP Academy · Leçon

Attention multi-têtes et positions

De multiples points de vue et la prise en compte de l’ordre

Leçon 3 sur 413 étapes

Attention multi-têtes et positions est une leçon NLP Academy gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage NLP Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours NLP Academy comprend 4 leçons au total.

Un seul mécanisme d’attention est limité

Une seule tête d’attention ne peut suivre qu’un seul type de relation à la fois. La langue réelle exige de repérer de nombreux schémas simultanément. 🧠

De nombreuses têtes, de nombreux points de vue

L’attention multi-tête exécute plusieurs calculs d’attention en parallèle, chacun avec ses propres projections apprises et son propre centre d’intérêt.

Ce que chaque tête apprend

Une tête peut suivre les liens sujet-verbe, tandis qu’une autre suit les pronoms. Ensemble, elles saisissent une représentation bien plus riche de la phrase.

Répartir les dimensions

Le modèle répartit la taille de son vecteur entre les têtes, de sorte que chaque tête travaille dans un sous-espace plus petit. Le coût total des calculs reste à peu près le même.

d_head = d_model // num_heads

Combiner les têtes

Après que chaque tête a produit une sortie, vous les concaténez, puis transmettez le résultat à une couche linéaire supplémentaire pour mélanger les différents points de vue.

out = concat(head_1, head_2, ...) @ W_o

L’attention ignore l’ordre

L’auto-attention traite l’entrée comme un ensemble ; à elle seule, elle ne peut donc pas distinguer « dog bites man » de « man bites dog ». Elle est insensible à l’ordre.

Ajouter l’information de position

Pour corriger cela, nous injectons un codage positionnel dans chaque mot afin que le modèle sache où se trouve chaque unité dans la séquence.

Codages sinusoïdaux

Le transformeur d’origine utilise des ondes fixes de sinus et de cosinus à différentes fréquences pour donner à chaque position une signature unique et régulière.

pe[pos, 2i] = sin(pos / 10000 ** (2*i/d))

Ajouter, et non concaténer

Les vecteurs de position sont ajoutés aux représentations vectorielles des mots, et non placés à la fin. Chaque unité porte donc à la fois son sens et sa position.

x = token_embeddings + positional_encoding

Des positions apprises également

De nombreux modèles modernes remplacent les ondes fixes par des représentations vectorielles de position apprises, entraînées avec le reste du modèle pour plus de flexibilité.

Pourquoi les deux sont importantes

L’attention multi-tête repère de nombreuses relations ; les codages positionnels rétablissent l’ordre. Ensemble, ils permettent au transformeur de réellement comprendre les séquences. ✨

Vérification rapide

Testons les positions et les têtes.

Récapitulatif

Vous avez vu comment l’attention multi-tête capture de nombreuses relations en parallèle, tandis que les codages positionnels donnent au modèle une notion de l’ordre. 🎯

Gratuit pour commencer

Apprends Python avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
30
Leçons
120

Questions Fréquemment Posées

La leçon « Attention multi-têtes et positions » est-elle gratuite ?

Oui — le texte complet de « Attention multi-têtes et positions » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours NLP Academy, passe à CoddyKit PRO. Le cours NLP Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Attention multi-têtes et positions » ?

De multiples points de vue et la prise en compte de l’ordre Tu pratiques NLP Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer NLP Academy ?

Aucune expérience préalable n'est requise. NLP Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.

Combien de temps prend la leçon « Attention multi-têtes et positions » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon NLP Academy ?

Oui. Chaque leçon NLP Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. L’idée de l’attention
  2. L’auto-attention, étape par étape
  3. Attention multi-têtes et positions
  4. À l’intérieur du bloc Transformer
← Retour à NLP Academy