Deep Learning Academy · Lezione

Gate LSTM e GRU

Memorizzi le dipendenze a lungo raggio

Lezione 3 di 413 passaggi

Gate LSTM e GRU è una lezione Deep Learning Academy gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Deep Learning Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Deep Learning Academy include 4 lezioni in totale.

Il problema della memoria a lungo termine

Le RNN vanilla dimenticano gli indizi iniziali nelle sequenze lunghe. Le celle con gate risolvono il problema decidendo cosa conservare, aggiornare o eliminare.

Ecco la LSTM

La LSTM aggiunge uno stato della cella separato, una sorta di autostrada della memoria che attraversa il tempo in linea retta, subendo solo piccole modifiche controllate.

I gate sono interruttori graduati

Un gate è un livello sigmoide che produce valori da 0 a 1. Zero blocca le informazioni, uno le lascia passare e i valori intermedi combinano i due effetti.

gate = torch.sigmoid(W @ x + U @ h)

Il forget gate

Il forget gate osserva l'input e la memoria e sceglie quali parti del vecchio stato della cella eliminare prima di aggiungere elementi nuovi.

L'input gate

L'input gate decide quante informazioni della nuova candidata devono essere scritte nello stato della cella a questo passaggio.

L'output gate

L'output gate controlla quanta parte dello stato della cella aggiornato diventa lo stato nascosto visibile, trasmesso al passaggio successivo. 🚪

Perché i gate aiutano i gradienti

Poiché lo stato della cella cambia gradualmente, i gradienti si propagano all'indietro attraverso molti passaggi senza svanire, permettendo al modello di apprendere schemi a lungo raggio.

Ecco la GRU

La GRU è una versione più leggera: combina i gate ed elimina lo stato della cella separato, offrendo una capacità simile con meno parametri.

I due gate della GRU

Una GRU usa solo due gate, un gate di reset e un update gate, per bilanciare la vecchia memoria con il nuovo input a ogni passaggio.

Sostituzione immediata in PyTorch

Entrambe si definiscono con una sola riga in PyTorch. Sostituisca nn.LSTM o nn.GRU a nn.RNN e mantenga quasi invariato il codice di addestramento.

lstm = nn.LSTM(input_size=10, hidden_size=20)

Quale scegliere?

Le GRU sono più veloci e spesso raggiungono le LSTM; le LSTM possono ottenere risultati leggermente migliori nelle sequenze lunghe più difficili. Provi entrambe e lasci decidere il punteggio di validazione.

Controllo rapido

Qual è il compito del forget gate in una LSTM?

Riepilogo

Le LSTM e le GRU usano i gate per controllare la memoria, permettendo ai gradienti di sopravvivere nelle sequenze lunghe e catturando dipendenze distanti. ✅

Gratis per iniziare

Impara Python con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
30
Lezioni
120

Domande Frequenti

La lezione «Gate LSTM e GRU» è gratuita?

Sì — il testo completo di «Gate LSTM e GRU» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Deep Learning Academy, passa a CoddyKit PRO. Il corso Deep Learning Academy include 4 lezioni in totale.

Cosa imparerò in «Gate LSTM e GRU»?

Memorizzi le dipendenze a lungo raggio Eserciti Deep Learning Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare Deep Learning Academy?

Non è richiesta alcuna esperienza precedente. Deep Learning Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.

Quanto tempo richiede la lezione «Gate LSTM e GRU»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione Deep Learning Academy?

Sì. Ogni lezione Deep Learning Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Perché le sequenze hanno bisogno di memoria
  2. La cella RNN vanilla
  3. Gate LSTM e GRU
  4. Impacchettare le sequenze e gestire il padding
← Torna a Deep Learning Academy