Adam og AdamW forklaret
Adaptive rates plus afkoblet weight decay.
Adam og AdamW forklaret er en gratis Deep Learning Academy-lektion på CoddyKit. Dette er lektion 2 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Deep Learning Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Deep Learning Academy-kurset indeholder 4 lektioner i alt.
Én rate pr. vægt
SGD bruger én læringsrate for hver parameter. Adam tilpasser trinstørrelsen for hver vægt individuelt ud fra vægtens historik over gradienter.
To løbende gennemsnit
Adam følger to løbende gennemsnit: gennemsnittet af gradienterne og gennemsnittet af deres kvadrater. Tilsammen udgør de det første og andet moment.
Det første moment er momentum
Det første moment er grundlæggende momentum, det udglattede gennemsnit af de seneste gradienter. Det bestemmer den overordnede retning, hver vægt skal bevæge sig i.
Det andet moment skalerer trinene
Det andet moment anslår størrelsen på hver gradient. Adam dividerer med dens kvadratrod, så støjende vægte tager mindre skridt, mens rolige vægte tager større.
Betaerne
To henfaldsrater, betaerne, styrer disse gennemsnit, typisk 0.9 og 0.999. De afvejer, hvor meget nyere kontra ældre gradienter betyder.
Bias-korrektion
Gennemsnittene starter ved nul, så de første trin ser for små ud. Adam anvender en bias-korrektion, så opdateringerne bliver fornuftige fra første trin.
Brug det i PyTorch
Én linje giver dig Adam. Standardlæringsraten på 0.001 fungerer godt på tværs af et enormt udvalg af modeller, og derfor er den så populær.
opt = torch.optim.Adam(model.parameters(), lr=1e-3)Adams fejl ved weight decay
Klassisk Adam blander weight decay ind i gradienten, hvor den adaptive skalering forvrider den. Regulariseringen bliver dermed svagere end tilsigtet.
AdamW løser det
AdamW adskiller weight decay fra gradienttrinnet og anvender det direkte på vægtene. Decay fungerer nu som en ren og forudsigelig formindskning.
opt = torch.optim.AdamW(model.parameters(), lr=1e-3, weight_decay=0.01)Det moderne standardvalg
For transformere og de fleste store modeller er AdamW standardvalget. Vælg det først, når du ønsker hurtig og pålidelig konvergens.
Adaptiv, men med forbehold
Adam træner ofte hurtigere end SGD, men almindelig SGD med momentum kan generalisere bedre på synsopgaver. Prøv begge, når nøjagtigheden virkelig tæller.
Hurtigt tjek
Få styr på forskellen mellem Adam og AdamW.
Opsummering
Adam tilpasser læringsraten for hver vægt ved hjælp af gradientens middelværdi og varians, mens AdamW anvender separat vægtdæmpning. AdamW er i dag den foretrukne optimeringsalgoritme. ⚙️
Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 30
- Lektioner
- 120
Ofte stillede spørgsmål
Er lektionen “Adam og AdamW forklaret” gratis?
Ja — hele teksten til “Adam og AdamW forklaret” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Deep Learning Academy-kurset, skal du opgradere til CoddyKit PRO. Deep Learning Academy-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “Adam og AdamW forklaret”?
Adaptive rates plus afkoblet weight decay. Du øver dig i Deep Learning Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Deep Learning Academy?
Der kræves ingen tidligere erfaring. Deep Learning Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 4.
Hvor lang tid tager lektionen “Adam og AdamW forklaret”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Deep Learning Academy-lektion?
Ja. Alle Deep Learning Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- SGD med momentum
- Adam og AdamW forklaret
- Weight decay vs. L2-regularisering
- Learning rate-schedules og warmup