Deep Learning Academy · Lektion

Learning rate-schedules og warmup

Strategier med step, cosine og warmup.

Lektion 4 af 413 trin

Learning rate-schedules og warmup er en gratis Deep Learning Academy-lektion på CoddyKit. Dette er lektion 4 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Deep Learning Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Deep Learning Academy-kurset indeholder 4 lektioner i alt.

En rate, der ændrer sig

Én fast læringsrate er sjældent ideel under hele træningen. En plan ændrer den over tid, normalt fra stor i starten til lille mod slutningen.

Hvorfor aftagning hjælper

Store skridt i starten dækker hurtigt et stort område. Når raten senere formindskes, kan modellen falde til ro præcist i et minimum i stedet for at hoppe omkring det.

Trinvis aftagning

Den enkleste plan er trinvis aftagning: Sæt raten ned med en fast faktor efter et bestemt antal epoker, for eksempel ved at halvere den hver tredivte epoke.

sched = torch.optim.lr_scheduler.StepLR(opt, step_size=30, gamma=0.5)

Cosinus-annealing

Cosinus-planer lader raten glide ned ad en jævn kurve mod nul. Den blide, gradvise aftagning er populær ved træning af moderne netværk.

sched = torch.optim.lr_scheduler.CosineAnnealingLR(opt, T_max=100)

Problemet med kold start

Nye vægte er sårbare. En rate i fuld størrelse på det første trin kan få fejlen til at eksplodere, især med store batches eller dybe transformere.

Warmup starter forsigtigt

Warmup øger raten fra næsten nul over de første par hundrede trin. Denne blide start holder den tidlige træning stabil, før den kommer op i fuldt tempo.

Warmup efterfulgt af aftagning

Den klassiske opskrift er warmup efterfulgt af aftagning: Øg raten til maksimum, og følg derefter en cosinus-kurve nedad. Det er den foretrukne metode til store modeller.

Trinvis opdatering af planlæggeren

En planlægger gør ingenting, før du kalder step() på den, normalt én gang pr. epoke, lige efter at optimeringsalgoritmen har opdateret vægtene.

opt.step()
sched.step()

Hold øje med den aktuelle rate

Log den aktuelle læringsrate, mens du træner. Når du kan se den stige under warmup og derefter aftage, bekræfter det, at planen aktiveres som forventet, og det hjælper dig med at fejlfinde.

print(sched.get_last_lr())

Aftagning baseret på plateau

Vil du hellere reagere på resultaterne? ReduceLROnPlateau sænker kun raten, når valideringsfejlen ikke længere bliver bedre, uden behov for en fast tidsplan.

sched = torch.optim.lr_scheduler.ReduceLROnPlateau(opt)

Planer giver nemme forbedringer

En god plan øger ofte den endelige nøjagtighed uden ekstra data. Warmup plus cosinus-aftagning er et stærkt og sikkert udgangspunkt.

Hurtigt tjek

Bekræft, hvad warmup bruges til.

Opsummering

En plan formindsker læringsraten over tid, så modellen falder godt til ro, mens warmup først øger den for at give en stabil start. Warmup plus cosinus er et godt standardvalg. 📉

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
30
Lektioner
120

Ofte stillede spørgsmål

Er lektionen “Learning rate-schedules og warmup” gratis?

Ja — hele teksten til “Learning rate-schedules og warmup” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Deep Learning Academy-kurset, skal du opgradere til CoddyKit PRO. Deep Learning Academy-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Learning rate-schedules og warmup”?

Strategier med step, cosine og warmup. Du øver dig i Deep Learning Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Deep Learning Academy?

Der kræves ingen tidligere erfaring. Deep Learning Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 4 af 4.

Hvor lang tid tager lektionen “Learning rate-schedules og warmup”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Deep Learning Academy-lektion?

Ja. Alle Deep Learning Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. SGD med momentum
  2. Adam og AdamW forklaret
  3. Weight decay vs. L2-regularisering
  4. Learning rate-schedules og warmup
← Tilbage til Deep Learning Academy