Dentro del bloque Transformer
Cómo encaja toda la arquitectura
Dentro del bloque Transformer es una lección gratuita de NLP Academy en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de NLP Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de NLP Academy incluye 4 lecciones en total.
Apilar bloques
Un Transformer se construye apilando muchas veces el mismo bloque. Cada bloque refina un poco más la representación. 🧱
Dos subcapas principales
Cada bloque tiene dos partes: una subcapa de atención multicabeza, seguida de una pequeña red de alimentación hacia adelante aplicada a cada posición.
La red de alimentación hacia adelante
La subcapa feed-forward consta de dos capas lineales con una no linealidad entre ellas y procesa cada token de forma independiente para aportar más capacidad.
h = relu(x @ W1 + b1) @ W2 + b2Conexiones residuales
Cada subcapa envuelve su entrada en una conexión residual: suma de nuevo la entrada a la salida para que los gradientes fluyan y no se pierda información.
out = x + sublayer(x)Normalización por capas
Después de sumar la conexión residual, la normalización por capas vuelve a escalar los valores. Esto mantiene estables las activaciones y acelera el entrenamiento.
out = layer_norm(x + sublayer(x))Bloques del codificador
Una pila de codificador lee la entrada y construye vectores de contexto ricos. Utiliza autoatención para que cada token vea todos los demás.
Bloques del decodificador
Un decodificador genera la salida un token a la vez. Añade atención enmascarada y atención cruzada hacia el codificador.
Atención enmascarada
Durante la generación, el enmascaramiento oculta los tokens futuros, de modo que el decodificador no pueda adelantarse y tenga que predecir honestamente la palabra siguiente.
Atención cruzada
La atención cruzada permite que el decodificador consulte las salidas del codificador y conecte lo que está escribiendo con lo que leyó originalmente.
La profundidad aporta capacidad
Apilar muchos bloques permite que las primeras capas detecten patrones simples y que las posteriores construyan un significado abstracto, de forma parecida a las redes profundas de visión.
¿Codificador, decodificador o ambos?
BERT utiliza solo el codificador, GPT utiliza solo el decodificador y los modelos de traducción utilizan ambos. El bloque es la unidad de construcción compartida. 🚀
Comprobación rápida
Comprobemos la estructura del bloque.
Resumen
Ha ensamblado el bloque Transformer: atención más alimentación hacia adelante, envueltas en conexiones residuales y normalización por capas, y apiladas en codificadores y decodificadores. ✨
Aprende Python con un tutor de IA — gratis
Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.
- Cursos
- 30
- Lecciones
- 120
Preguntas frecuentes
¿La lección «Dentro del bloque Transformer» es gratis?
Sí — el texto completo de «Dentro del bloque Transformer» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de NLP Academy, actualiza a CoddyKit PRO. El curso de NLP Academy incluye 4 lecciones en total.
¿Qué aprenderé en «Dentro del bloque Transformer»?
Cómo encaja toda la arquitectura Practicas NLP Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar NLP Academy?
No se requiere experiencia previa. NLP Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.
¿Cuánto tiempo toma la lección «Dentro del bloque Transformer»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de NLP Academy?
Sí. Cada lección de NLP Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- La idea de la atención
- Self-attention paso a paso
- Atención multi-cabeza y posiciones
- Dentro del bloque Transformer