Sigmoid y Tanh: comprimir a un rango
Salidas acotadas y la trampa del gradiente desvanecido
Sigmoid y Tanh: comprimir a un rango es una lección gratuita de Deep Learning Academy en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Deep Learning Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Deep Learning Academy incluye 4 lecciones en total.
Partes de esta lección aún no han sido traducidas y se muestran en inglés.
Squashing Activations
Some activations squeeze any input into a fixed range. The two classics are sigmoid and tanh, and both bend big numbers gently inward. 🤏
Sigmoid's Range
Sigmoid maps every value into the open interval from 0 to 1. That makes its output read naturally as a probability.
import torch
y = torch.sigmoid(x) # outputs between 0 and 1Its S-Shaped Curve
Sigmoid has a smooth S shape: near zero it changes fast, but far out it flattens. Large inputs all map to nearly the same value.
Tanh's Range
Tanh is sigmoid's cousin, but it squashes inputs into the range from minus 1 to plus 1, centered neatly on zero.
y = torch.tanh(x) # outputs between -1 and 1Why Centering Helps
Because tanh is zero-centered, its outputs balance around zero. That often gives smoother, faster learning than sigmoid for hidden layers.
The Flat Tails
Out at the edges, both curves go almost flat. A flat region means a tiny slope, and a tiny slope means a tiny gradient.
Vanishing Gradients
When gradients shrink toward zero, early layers barely update. This vanishing gradient trap stalls deep networks during training. 😴
Why ReLU Took Over
This vanishing problem is exactly why ReLU replaced sigmoid and tanh in most hidden layers. ReLU keeps a healthy gradient for positives.
Where Sigmoid Still Wins
Sigmoid stays useful at the output of a binary classifier, where you genuinely want a single probability between 0 and 1.
Where Tanh Still Wins
Tanh still appears inside recurrent cells like LSTMs, where its bounded, zero-centered output helps keep the hidden state stable.
Choosing Wisely
Rule of thumb: avoid sigmoid and tanh in deep hidden stacks, but keep sigmoid for a single probability output. Match the tool to the job.
Quick Check
Recall what happens at the flat tails of these curves.
Recap
Sigmoid squashes to 0 to 1 and tanh to minus 1 to 1. Their flat tails cause vanishing gradients, so save them for outputs and special cells. 🎯
Preguntas frecuentes
¿La lección «Sigmoid y Tanh: comprimir a un rango» es gratis?
Sí — el texto completo de «Sigmoid y Tanh: comprimir a un rango» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Deep Learning Academy, actualiza a CoddyKit PRO. El curso de Deep Learning Academy incluye 4 lecciones en total.
¿Qué aprenderé en «Sigmoid y Tanh: comprimir a un rango»?
Salidas acotadas y la trampa del gradiente desvanecido Practicas Deep Learning Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar Deep Learning Academy?
No se requiere experiencia previa. Deep Learning Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.
¿Cuánto tiempo toma la lección «Sigmoid y Tanh: comprimir a un rango»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de Deep Learning Academy?
Sí. Cada lección de Deep Learning Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Por qué la no linealidad desbloquea el verdadero potencial
- ReLU y sus variantes Leaky y GELU
- Sigmoid y Tanh: comprimir a un rango
- Softmax para obtener probabilidades