Deep Learning Academy · Lezione

Sigmoid e Tanh: comprimere in un intervallo

Output limitati e il problema del gradiente evanescente

Lezione 3 di 413 passaggi

Sigmoid e Tanh: comprimere in un intervallo è una lezione Deep Learning Academy gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Deep Learning Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Deep Learning Academy include 4 lezioni in totale.

Le attivazioni che comprimono

Alcune attivazioni comprimono ogni input in un intervallo fisso. Le due classiche sono sigmoid e tanh, che riportano entrambe con gradualità i numeri grandi verso l'interno. 🤏

L'intervallo di sigmoid

Sigmoid mappa ogni valore nell'intervallo aperto tra 0 e 1. Per questo il suo output si interpreta naturalmente come una probabilità.

import torch
y = torch.sigmoid(x)   # outputs between 0 and 1

La sua curva a S

Sigmoid ha una forma a S morbida: vicino a zero cambia rapidamente, mentre lontano da zero si appiattisce. Gli input grandi vengono tutti mappati su valori quasi uguali.

L'intervallo di tanh

Tanh è una parente di sigmoid, ma comprime gli input nell'intervallo tra meno 1 e più 1, centrato esattamente su zero.

y = torch.tanh(x)   # outputs between -1 and 1

Perché il centraggio aiuta

Poiché tanh è centrata su zero, i suoi output sono bilanciati attorno allo zero. Per i livelli nascosti questo porta spesso a un apprendimento più regolare e veloce rispetto a sigmoid.

Le estremità piatte

Agli estremi, entrambe le curve diventano quasi piatte. Una regione piatta indica una pendenza minima, e una pendenza minima implica un gradiente minimo.

Gradienti evanescenti

Quando i gradienti si avvicinano allo zero, i primi livelli si aggiornano a malapena. Questa trappola del gradiente evanescente blocca l'addestramento delle reti profonde. 😴

Perché ReLU ha prevalso

Questo problema del gradiente evanescente spiega proprio perché ReLU ha sostituito sigmoid e tanh nella maggior parte dei livelli nascosti. ReLU mantiene un gradiente efficace per i valori positivi.

Dove sigmoid è ancora preferibile

Sigmoid resta utile nell'output di un classificatore binario, quando serve effettivamente una singola probabilità compresa tra 0 e 1.

Dove tanh è ancora preferibile

tanh compare ancora all’interno di celle ricorrenti come LSTM, dove la sua uscita limitata e centrata sullo zero aiuta a mantenere stabile lo stato nascosto.

Scegliere con criterio

Regola generale: evitate sigmoid e tanh negli stack nascosti profondi, ma mantenete sigmoid per un’unica uscita di probabilità. Scegliete lo strumento adatto al compito.

Controllo rapido

Ricordate cosa accade alle estremità piatte di queste curve.

Riepilogo

Sigmoid comprime i valori nell’intervallo da 0 a 1, mentre tanh nell’intervallo da -1 a 1. Le loro estremità piatte causano gradienti evanescenti, quindi riservatele alle uscite e alle celle speciali. 🎯

Gratis per iniziare

Impara Python con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
30
Lezioni
120

Domande Frequenti

La lezione «Sigmoid e Tanh: comprimere in un intervallo» è gratuita?

Sì — il testo completo di «Sigmoid e Tanh: comprimere in un intervallo» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Deep Learning Academy, passa a CoddyKit PRO. Il corso Deep Learning Academy include 4 lezioni in totale.

Cosa imparerò in «Sigmoid e Tanh: comprimere in un intervallo»?

Output limitati e il problema del gradiente evanescente Eserciti Deep Learning Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare Deep Learning Academy?

Non è richiesta alcuna esperienza precedente. Deep Learning Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.

Quanto tempo richiede la lezione «Sigmoid e Tanh: comprimere in un intervallo»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione Deep Learning Academy?

Sì. Ogni lezione Deep Learning Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Perché la non linearità sblocca il vero potenziale
  2. ReLU e le sue cugine Leaky e GELU
  3. Sigmoid e Tanh: comprimere in un intervallo
  4. Softmax per le probabilità
← Torna a Deep Learning Academy