Deep Learning Academy · Lezione

ReLU e le sue cugine Leaky e GELU

L'attivazione predefinita e le varianti moderne

Lezione 2 di 413 passaggi

ReLU e le sue cugine Leaky e GELU è una lezione Deep Learning Academy gratuita su CoddyKit. Questa è la lezione 2 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Deep Learning Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Deep Learning Academy include 4 lezioni in totale.

Ecco ReLU

L'attivazione più diffusa è ReLU: mantiene i valori positivi e trasforma ogni valore negativo in zero. Semplice e veloce. ⚡

import torch.nn.functional as F
y = F.relu(x)   # max(0, x), elementwise

Perché si è diffusa

ReLU è economica da calcolare e il suo gradiente vale esattamente 1 per i valori positivi. Questo mantiene il flusso dei segnali e consente di addestrare rapidamente le reti profonde.

La matematica

ReLU è semplicemente max(0, x). Gli input positivi passano invariati, mentre quelli negativi vengono ridotti a zero. Tutto il meccanismo consiste in questa singola cerniera.

Il problema della ReLU morente

Se un neurone restituisce sempre zero, anche il suo gradiente è zero e smette quindi di apprendere per sempre. Si parla di neurone morto. 💀

Leaky ReLU in soccorso

Leaky ReLU lascia passare una piccola pendenza per i valori negativi invece di imporre uno zero netto. Questa piccola perdita mantiene attivi i neuroni morti.

y = F.leaky_relu(x, negative_slope=0.01)

ReLU parametrica

PReLU fa un passo in più: apprende la pendenza negativa durante l'addestramento invece di fissarla. È la rete stessa a regolare la perdita.

Ecco GELU

GELU trasforma l'angolo di ReLU in una curva morbida. Regola gli input in base alla probabilità che siano utili, invece di usare un limite netto.

y = F.gelu(x)

Perché i transformer amano GELU

I modelli moderni, come i transformer, prediligono GELU perché la sua forma morbida produce gradienti più graduali. Questo spesso rende l'addestramento più stabile. 🤖

SiLU e simili

SiLU, chiamata anche Swish, moltiplica l'input per la propria funzione sigmoide. Come GELU, è morbida e spesso offre risultati leggermente migliori della semplice ReLU.

Una scelta predefinita sensata

Inizi con ReLU per i livelli nascosti: è veloce e affidabile. Ricorra a Leaky ReLU o GELU solo se nota neuroni morti o desidera una maggiore morbidezza.

Usarla come livello

È possibile inserire queste funzioni come moduli all'interno di un modello, non soltanto come funzioni. Questo le rende facili da concatenare in nn.Sequential.

import torch.nn as nn
net = nn.Sequential(nn.Linear(4, 8), nn.ReLU())

Verifica rapida

Rifletta su un neurone che finisce sempre nella zona negativa.

Riepilogo

ReLU è la scelta predefinita e veloce, ma può far morire i neuroni. Leaky ReLU, PReLU e GELU ammorbidiscono o lasciano passare i valori negativi, mantenendo efficace l'apprendimento. 🌟

Gratis per iniziare

Impara Python con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
30
Lezioni
120

Domande Frequenti

La lezione «ReLU e le sue cugine Leaky e GELU» è gratuita?

Sì — il testo completo di «ReLU e le sue cugine Leaky e GELU» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Deep Learning Academy, passa a CoddyKit PRO. Il corso Deep Learning Academy include 4 lezioni in totale.

Cosa imparerò in «ReLU e le sue cugine Leaky e GELU»?

L'attivazione predefinita e le varianti moderne Eserciti Deep Learning Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare Deep Learning Academy?

Non è richiesta alcuna esperienza precedente. Deep Learning Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 2 di 4.

Quanto tempo richiede la lezione «ReLU e le sue cugine Leaky e GELU»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione Deep Learning Academy?

Sì. Ogni lezione Deep Learning Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Perché la non linearità sblocca il vero potenziale
  2. ReLU e le sue cugine Leaky e GELU
  3. Sigmoid e Tanh: comprimere in un intervallo
  4. Softmax per le probabilità
← Torna a Deep Learning Academy