Deep Learning Academy · Lezione

Scheduler del learning rate e warmup

Strategie step, coseno e warmup

Lezione 4 di 413 passaggi

Scheduler del learning rate e warmup è una lezione Deep Learning Academy gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Deep Learning Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Deep Learning Academy include 4 lezioni in totale.

Un learning rate variabile

Un learning rate fisso raramente è ideale per tutta l'esecuzione. Uno schedule lo modifica nel tempo, di solito mantenendolo alto all'inizio e basso verso la fine.

Perché il decay aiuta

Passi iniziali ampi permettono di coprire rapidamente molto terreno. Ridurre il learning rate in seguito consente al modello di stabilizzarsi con precisione in un minimo, invece di oscillare attorno a esso.

Step decay

Lo schedule più semplice è lo step decay: riduce il learning rate di un fattore fisso ogni determinato numero di epoche, ad esempio dimezzandolo ogni trenta epoche.

sched = torch.optim.lr_scheduler.StepLR(opt, step_size=30, gamma=0.5)

Cosine annealing

Gli schedule cosine fanno diminuire il learning rate lungo una curva regolare fino a zero. Questo decay graduale e delicato è molto usato per addestrare le reti moderne.

sched = torch.optim.lr_scheduler.CosineAnnealingLR(opt, T_max=100)

Il problema della partenza a freddo

I pesi iniziali sono fragili. Un learning rate a piena intensità già al primo passaggio può far esplodere la loss, soprattutto con batch grandi o transformer profondi.

Il warmup facilita l'avvio

Il warmup aumenta gradualmente il learning rate da un valore vicino a zero durante le prime centinaia di passaggi. Questo avvio delicato mantiene stabile l'addestramento iniziale prima di raggiungere la piena velocità.

Prima warmup, poi decay

La ricetta classica prevede warmup seguito da decay: si raggiunge il learning rate massimo e poi si segue una curva cosine discendente. È la scelta predefinita per i modelli grandi.

Eseguire lo scheduler

Uno scheduler non fa nulla finché non si chiama step() su di esso, di solito una volta per epoca subito dopo che l'ottimizzatore ha aggiornato i pesi.

opt.step()
sched.step()

Controllare il learning rate corrente

Registri il learning rate effettivo durante l'addestramento. Osservarne il warmup e il decay conferma che lo schedule viene applicato quando previsto e la aiuta a fare debug.

print(sched.get_last_lr())

Decay basato sul plateau

Preferisce reagire ai risultati? ReduceLROnPlateau riduce il learning rate solo quando la loss di validazione smette di migliorare, senza bisogno di una tabella di marcia fissa.

sched = torch.optim.lr_scheduler.ReduceLROnPlateau(opt)

Gli schedule sono vantaggi gratuiti

Un buon schedule spesso migliora l'accuratezza finale senza dati aggiuntivi. Warmup più decay cosine è un punto di partenza solido e sicuro.

Verifica rapida

Confermi a cosa serve il warmup.

Riepilogo

Uno schedule riduce il learning rate nel tempo, così il modello si stabilizza correttamente, mentre il warmup lo aumenta prima per garantire un avvio stabile. Warmup più cosine è un'ottima impostazione predefinita. 📉

Gratis per iniziare

Impara Python con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
30
Lezioni
120

Domande Frequenti

La lezione «Scheduler del learning rate e warmup» è gratuita?

Sì — il testo completo di «Scheduler del learning rate e warmup» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Deep Learning Academy, passa a CoddyKit PRO. Il corso Deep Learning Academy include 4 lezioni in totale.

Cosa imparerò in «Scheduler del learning rate e warmup»?

Strategie step, coseno e warmup Eserciti Deep Learning Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare Deep Learning Academy?

Non è richiesta alcuna esperienza precedente. Deep Learning Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.

Quanto tempo richiede la lezione «Scheduler del learning rate e warmup»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione Deep Learning Academy?

Sì. Ogni lezione Deep Learning Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. SGD con momentum
  2. Adam e AdamW spiegati
  3. Weight decay e regolarizzazione L2 a confronto
  4. Scheduler del learning rate e warmup
← Torna a Deep Learning Academy