NLP Academy · Lección

Atención multi-cabeza y posiciones

Múltiples perspectivas y consciencia del orden

Lección 3 de 413 pasos

Atención multi-cabeza y posiciones es una lección gratuita de NLP Academy en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de NLP Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de NLP Academy incluye 4 lecciones en total.

Una sola cabeza es limitada

Una sola cabeza de atención solo puede seguir un tipo de relación a la vez. El lenguaje real necesita detectar muchos patrones a la vez. 🧠

Muchas cabezas, muchas perspectivas

La atención multicabeza ejecuta varios cálculos de atención en paralelo, cada uno con sus propias proyecciones aprendidas y su propio enfoque.

Qué aprende cada cabeza

Una cabeza puede seguir relaciones entre sujeto y verbo, mientras otra sigue los pronombres. Juntas capturan una representación mucho más rica de la oración.

Dividir las dimensiones

El modelo divide el tamaño de su vector entre las cabezas, de modo que cada cabeza trabaja en un subespacio más pequeño. El costo computacional total se mantiene aproximadamente igual.

d_head = d_model // num_heads

Combinar las cabezas

Después de que cada cabeza produce una salida, se concatenan y el resultado pasa por otra capa lineal para combinar las perspectivas.

out = concat(head_1, head_2, ...) @ W_o

La atención ignora el orden

La autoatención trata la entrada como un conjunto, por lo que por sí sola no puede distinguir «dog bites man» de «man bites dog». Es ciega al orden.

Añadir información posicional

Para solucionar esto, inyectamos una codificación posicional en cada palabra, de modo que el modelo sepa dónde se encuentra cada token en la secuencia.

Codificaciones sinusoidales

El Transformer original utiliza ondas fijas de seno y coseno con distintas frecuencias para dar a cada posición una firma única y suave.

pe[pos, 2i] = sin(pos / 10000 ** (2*i/d))

Se suman, no se añaden al final

Los vectores posicionales se suman a las representaciones vectoriales de las palabras, no se colocan al final. Así, cada token contiene a la vez su significado y su posición.

x = token_embeddings + positional_encoding

También se pueden aprender las posiciones

Muchos modelos modernos sustituyen las ondas fijas por representaciones posicionales aprendidas, entrenadas junto con todo lo demás para ofrecer mayor flexibilidad.

Por qué importan ambas

La atención multicabeza detecta muchas relaciones, mientras que las codificaciones posicionales restauran el orden. Juntas permiten que el Transformer comprenda realmente las secuencias. ✨

Comprobación rápida

Probemos las posiciones y las cabezas.

Resumen

Ha visto cómo la atención multicabeza captura muchas relaciones en paralelo, mientras que las codificaciones posicionales proporcionan al modelo una noción del orden. 🎯

Gratis para empezar

Aprende Python con un tutor de IA — gratis

Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.

Cursos
30
Lecciones
120

Preguntas frecuentes

¿La lección «Atención multi-cabeza y posiciones» es gratis?

Sí — el texto completo de «Atención multi-cabeza y posiciones» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de NLP Academy, actualiza a CoddyKit PRO. El curso de NLP Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Atención multi-cabeza y posiciones»?

Múltiples perspectivas y consciencia del orden Practicas NLP Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar NLP Academy?

No se requiere experiencia previa. NLP Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.

¿Cuánto tiempo toma la lección «Atención multi-cabeza y posiciones»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de NLP Academy?

Sí. Cada lección de NLP Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. La idea de la atención
  2. Self-attention paso a paso
  3. Atención multi-cabeza y posiciones
  4. Dentro del bloque Transformer
← Volver a NLP Academy