Sigmoid e Tanh: Comprimindo para um Intervalo
Saídas limitadas e a armadilha do gradiente que desaparece
Sigmoid e Tanh: Comprimindo para um Intervalo é uma aula grátis de Deep Learning Academy no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Deep Learning Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Deep Learning Academy inclui 4 aulas no total.
Partes desta aula ainda não foram traduzidas e aparecem em inglês.
Squashing Activations
Some activations squeeze any input into a fixed range. The two classics are sigmoid and tanh, and both bend big numbers gently inward. 🤏
Sigmoid's Range
Sigmoid maps every value into the open interval from 0 to 1. That makes its output read naturally as a probability.
import torch
y = torch.sigmoid(x) # outputs between 0 and 1Its S-Shaped Curve
Sigmoid has a smooth S shape: near zero it changes fast, but far out it flattens. Large inputs all map to nearly the same value.
Tanh's Range
Tanh is sigmoid's cousin, but it squashes inputs into the range from minus 1 to plus 1, centered neatly on zero.
y = torch.tanh(x) # outputs between -1 and 1Why Centering Helps
Because tanh is zero-centered, its outputs balance around zero. That often gives smoother, faster learning than sigmoid for hidden layers.
The Flat Tails
Out at the edges, both curves go almost flat. A flat region means a tiny slope, and a tiny slope means a tiny gradient.
Vanishing Gradients
When gradients shrink toward zero, early layers barely update. This vanishing gradient trap stalls deep networks during training. 😴
Why ReLU Took Over
This vanishing problem is exactly why ReLU replaced sigmoid and tanh in most hidden layers. ReLU keeps a healthy gradient for positives.
Where Sigmoid Still Wins
Sigmoid stays useful at the output of a binary classifier, where you genuinely want a single probability between 0 and 1.
Where Tanh Still Wins
Tanh still appears inside recurrent cells like LSTMs, where its bounded, zero-centered output helps keep the hidden state stable.
Choosing Wisely
Rule of thumb: avoid sigmoid and tanh in deep hidden stacks, but keep sigmoid for a single probability output. Match the tool to the job.
Quick Check
Recall what happens at the flat tails of these curves.
Recap
Sigmoid squashes to 0 to 1 and tanh to minus 1 to 1. Their flat tails cause vanishing gradients, so save them for outputs and special cells. 🎯
Perguntas Frequentes
A aula “Sigmoid e Tanh: Comprimindo para um Intervalo” é grátis?
Sim — o texto completo de “Sigmoid e Tanh: Comprimindo para um Intervalo” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Deep Learning Academy, atualize para CoddyKit PRO. O curso de Deep Learning Academy inclui 4 aulas no total.
O que vou aprender em “Sigmoid e Tanh: Comprimindo para um Intervalo”?
Saídas limitadas e a armadilha do gradiente que desaparece Você pratica Deep Learning Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar Deep Learning Academy?
Nenhuma experiência prévia é necessária. Deep Learning Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.
Quanto tempo leva a aula “Sigmoid e Tanh: Comprimindo para um Intervalo”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de Deep Learning Academy?
Sim. Cada aula de Deep Learning Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Por Que a Não Linearidade Libera o Verdadeiro Poder
- ReLU e Suas Parentes Leaky e GELU
- Sigmoid e Tanh: Comprimindo para um Intervalo
- Softmax para Probabilidades