0Pricing
NLP Academy · Lezione

Il problema del gradiente evanescente

Perché le RNN semplici dimenticano

Il problema del gradiente evanescente è una lezione NLP Academy gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento NLP Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso NLP Academy include 4 lezioni in totale.

Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.

A Frustrating Limit

Plain RNNs look powerful, but they struggle to remember long-range context. The cause is the vanishing gradient problem.

Learning Means Gradients

Networks learn by sending error signals, called gradients, backward through time to nudge each weight in the right direction.

Backprop Through Time

For an RNN this backward pass unrolls across every step, so a long sentence means a very long chain of multiplications.

Small Numbers Shrink Fast

When you multiply many values below one together, the result rushes toward zero. The gradient fades long before it reaches early words.

Early Words Get Ignored

Because the signal vanishes, the network barely updates weights tied to the first tokens, so distant context is effectively lost.

A Quick Intuition

Imagine multiplying 0.5 by itself twenty times. The value almost disappears, and that is what happens to deep-step gradients.

g = 0.5
for _ in range(20): g *= 0.5
print(g)  # tiny

The Opposite Danger

Gradients can also explode when values exceed one, growing huge and destabilizing training with wild weight swings.

Taming Explosions

Exploding gradients have an easy patch: gradient clipping caps their size so a single step cannot blow up your model.

Vanishing Is Harder

Vanishing gradients resist simple fixes, so plain RNNs keep forgetting. We need a smarter cell to hold memory across many steps.

The Real Fix Ahead

Special architectures with gates, like LSTM and GRU, control what to keep and forget, preserving long-range signals.

Why It Matters

Understanding this limit explains why modern sequence models exist at all: they were designed to keep gradients alive over distance. 💡

Quick Check

Why do plain RNNs forget early words in long sequences?

Recap

In long sequences plain RNN gradients vanish, erasing distant context. Gated cells like LSTM and GRU are the fix we explore next. 🎯

Domande Frequenti

La lezione «Il problema del gradiente evanescente» è gratuita?

Sì — il testo completo di «Il problema del gradiente evanescente» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso NLP Academy, passa a CoddyKit PRO. Il corso NLP Academy include 4 lezioni in totale.

Cosa imparerò in «Il problema del gradiente evanescente»?

Perché le RNN semplici dimenticano Eserciti NLP Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare NLP Academy?

Non è richiesta alcuna esperienza precedente. NLP Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.

Quanto tempo richiede la lezione «Il problema del gradiente evanescente»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione NLP Academy?

Sì. Ogni lezione NLP Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Perché l'ordine conta nel linguaggio
  2. Come un RNN legge una sequenza
  3. Creare un modello testuale RNN
  4. Il problema del gradiente evanescente
← Torna a NLP Academy