El problema del gradiente evanescente
Por qué las RNN simples olvidan
El problema del gradiente evanescente es una lección gratuita de NLP Academy en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de NLP Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de NLP Academy incluye 4 lecciones en total.
Un límite frustrante
Las RNN simples parecen potentes, pero tienen dificultades para recordar el contexto de largo alcance. La causa es el problema del desvanecimiento del gradiente.
Aprender significa usar gradientes
Las redes aprenden enviando señales de error, llamadas gradientes, hacia atrás en el tiempo para ajustar cada peso en la dirección correcta.
Retropropagación a través del tiempo
En una RNN, este paso hacia atrás se despliega en cada instante, por lo que una oración larga implica una cadena muy larga de multiplicaciones.
Los números pequeños disminuyen rápidamente
Cuando multiplica entre sí muchos valores menores que uno, el resultado se aproxima rápidamente a cero. El gradiente se desvanece mucho antes de llegar a las primeras palabras.
Las primeras palabras se ignoran
Como la señal se desvanece, la red apenas actualiza los pesos asociados a los primeros tokens, por lo que el contexto lejano se pierde en la práctica.
Una intuición rápida
Imagine multiplicar 0,5 por sí mismo veinte veces. El valor casi desaparece, y eso es lo que ocurre con los gradientes tras muchos pasos.
g = 0.5
for _ in range(20): g *= 0.5
print(g) # tinyEl peligro contrario
Los gradientes también pueden explotar cuando los valores superan uno, crecer enormemente y desestabilizar el entrenamiento con cambios bruscos en los pesos.
Cómo controlar las explosiones
Los gradientes explosivos tienen una solución sencilla: el recorte de gradiente limita su tamaño para que un solo paso no desestabilice el modelo.
El desvanecimiento es más difícil
Los gradientes que se desvanecen se resisten a las soluciones sencillas, así que las RNN simples siguen olvidando información. Necesitamos una celda más inteligente que conserve la memoria durante muchos pasos.
La solución definitiva se acerca
Las arquitecturas especiales con puertas, como LSTM y GRU, controlan qué conservar y qué olvidar, preservando las señales de largo alcance.
Por qué es importante
Entender este límite explica por qué existen los modelos modernos de secuencias: se diseñaron para mantener vivos los gradientes a lo largo de la distancia. 💡
Comprobación rápida
¿Por qué las RNN simples olvidan las primeras palabras de las secuencias largas?
Repaso
En las secuencias largas, los gradientes de las RNN simples se desvanecen y eliminan el contexto lejano. Las celdas con puertas, como LSTM y GRU, son la solución que exploraremos a continuación. 🎯
Preguntas frecuentes
¿La lección «El problema del gradiente evanescente» es gratis?
Sí — el texto completo de «El problema del gradiente evanescente» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de NLP Academy, actualiza a CoddyKit PRO. El curso de NLP Academy incluye 4 lecciones en total.
¿Qué aprenderé en «El problema del gradiente evanescente»?
Por qué las RNN simples olvidan Practicas NLP Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar NLP Academy?
No se requiere experiencia previa. NLP Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.
¿Cuánto tiempo toma la lección «El problema del gradiente evanescente»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de NLP Academy?
Sí. Cada lección de NLP Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Por qué el orden importa en el lenguaje
- Cómo una RNN lee una secuencia
- Construcción de un modelo de texto con RNN
- El problema del gradiente evanescente