NLP Academy · Lección

Dentro del bloque Transformer

Cómo encaja toda la arquitectura

Lección 4 de 413 pasos

Dentro del bloque Transformer es una lección gratuita de NLP Academy en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de NLP Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de NLP Academy incluye 4 lecciones en total.

Apilar bloques

Un Transformer se construye apilando muchas veces el mismo bloque. Cada bloque refina un poco más la representación. 🧱

Dos subcapas principales

Cada bloque tiene dos partes: una subcapa de atención multicabeza, seguida de una pequeña red de alimentación hacia adelante aplicada a cada posición.

La red de alimentación hacia adelante

La subcapa feed-forward consta de dos capas lineales con una no linealidad entre ellas y procesa cada token de forma independiente para aportar más capacidad.

h = relu(x @ W1 + b1) @ W2 + b2

Conexiones residuales

Cada subcapa envuelve su entrada en una conexión residual: suma de nuevo la entrada a la salida para que los gradientes fluyan y no se pierda información.

out = x + sublayer(x)

Normalización por capas

Después de sumar la conexión residual, la normalización por capas vuelve a escalar los valores. Esto mantiene estables las activaciones y acelera el entrenamiento.

out = layer_norm(x + sublayer(x))

Bloques del codificador

Una pila de codificador lee la entrada y construye vectores de contexto ricos. Utiliza autoatención para que cada token vea todos los demás.

Bloques del decodificador

Un decodificador genera la salida un token a la vez. Añade atención enmascarada y atención cruzada hacia el codificador.

Atención enmascarada

Durante la generación, el enmascaramiento oculta los tokens futuros, de modo que el decodificador no pueda adelantarse y tenga que predecir honestamente la palabra siguiente.

Atención cruzada

La atención cruzada permite que el decodificador consulte las salidas del codificador y conecte lo que está escribiendo con lo que leyó originalmente.

La profundidad aporta capacidad

Apilar muchos bloques permite que las primeras capas detecten patrones simples y que las posteriores construyan un significado abstracto, de forma parecida a las redes profundas de visión.

¿Codificador, decodificador o ambos?

BERT utiliza solo el codificador, GPT utiliza solo el decodificador y los modelos de traducción utilizan ambos. El bloque es la unidad de construcción compartida. 🚀

Comprobación rápida

Comprobemos la estructura del bloque.

Resumen

Ha ensamblado el bloque Transformer: atención más alimentación hacia adelante, envueltas en conexiones residuales y normalización por capas, y apiladas en codificadores y decodificadores. ✨

Gratis para empezar

Aprende Python con un tutor de IA — gratis

Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.

Cursos
30
Lecciones
120

Preguntas frecuentes

¿La lección «Dentro del bloque Transformer» es gratis?

Sí — el texto completo de «Dentro del bloque Transformer» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de NLP Academy, actualiza a CoddyKit PRO. El curso de NLP Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Dentro del bloque Transformer»?

Cómo encaja toda la arquitectura Practicas NLP Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar NLP Academy?

No se requiere experiencia previa. NLP Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.

¿Cuánto tiempo toma la lección «Dentro del bloque Transformer»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de NLP Academy?

Sí. Cada lección de NLP Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. La idea de la atención
  2. Self-attention paso a paso
  3. Atención multi-cabeza y posiciones
  4. Dentro del bloque Transformer
← Volver a NLP Academy