Il problema del gradiente evanescente
Perché le RNN semplici dimenticano
Il problema del gradiente evanescente è una lezione NLP Academy gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento NLP Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso NLP Academy include 4 lezioni in totale.
Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.
A Frustrating Limit
Plain RNNs look powerful, but they struggle to remember long-range context. The cause is the vanishing gradient problem.
Learning Means Gradients
Networks learn by sending error signals, called gradients, backward through time to nudge each weight in the right direction.
Backprop Through Time
For an RNN this backward pass unrolls across every step, so a long sentence means a very long chain of multiplications.
Small Numbers Shrink Fast
When you multiply many values below one together, the result rushes toward zero. The gradient fades long before it reaches early words.
Early Words Get Ignored
Because the signal vanishes, the network barely updates weights tied to the first tokens, so distant context is effectively lost.
A Quick Intuition
Imagine multiplying 0.5 by itself twenty times. The value almost disappears, and that is what happens to deep-step gradients.
g = 0.5
for _ in range(20): g *= 0.5
print(g) # tinyThe Opposite Danger
Gradients can also explode when values exceed one, growing huge and destabilizing training with wild weight swings.
Taming Explosions
Exploding gradients have an easy patch: gradient clipping caps their size so a single step cannot blow up your model.
Vanishing Is Harder
Vanishing gradients resist simple fixes, so plain RNNs keep forgetting. We need a smarter cell to hold memory across many steps.
The Real Fix Ahead
Special architectures with gates, like LSTM and GRU, control what to keep and forget, preserving long-range signals.
Why It Matters
Understanding this limit explains why modern sequence models exist at all: they were designed to keep gradients alive over distance. 💡
Quick Check
Why do plain RNNs forget early words in long sequences?
Recap
In long sequences plain RNN gradients vanish, erasing distant context. Gated cells like LSTM and GRU are the fix we explore next. 🎯
Domande Frequenti
La lezione «Il problema del gradiente evanescente» è gratuita?
Sì — il testo completo di «Il problema del gradiente evanescente» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso NLP Academy, passa a CoddyKit PRO. Il corso NLP Academy include 4 lezioni in totale.
Cosa imparerò in «Il problema del gradiente evanescente»?
Perché le RNN semplici dimenticano Eserciti NLP Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare NLP Academy?
Non è richiesta alcuna esperienza precedente. NLP Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.
Quanto tempo richiede la lezione «Il problema del gradiente evanescente»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione NLP Academy?
Sì. Ogni lezione NLP Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Perché l'ordine conta nel linguaggio
- Come un RNN legge una sequenza
- Creare un modello testuale RNN
- Il problema del gradiente evanescente