Deep Learning Academy · Lektion

Adam och AdamW förklarade

Adaptiva hastigheter plus frikopplad viktdecay

Lektion 2 av 413 steg

Adam och AdamW förklarade är en gratis lektion i Deep Learning Academy på CoddyKit. Detta är lektion 2 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för Deep Learning Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i Deep Learning Academy innehåller totalt 4 lektioner.

En takt per vikt

SGD använder en enda learning rate för varje parameter. Adam anpassar steglängden för varje vikt separat, baserat på den viktens gradienthistorik.

Två glidande medelvärden

Adam följer två löpande medelvärden: medelvärdet av gradienterna och medelvärdet av deras kvadrater. Tillsammans bildar de den första och andra momenten.

Det första momentet är momentum

Det första momentet är i princip momentum, det utjämnade medelvärdet av de senaste gradienterna. Det avgör den övergripande riktningen som varje vikt ska röra sig i.

Det andra momentet skalar stegen

Det andra momentet uppskattar storleken på varje gradient. Adam dividerar med dess kvadratrot, så brusiga vikter tar mindre steg och lugna vikter tar större.

Betavärdena

Två avklingningstakter, betas, styr dessa medelvärden, vanligtvis 0.9 och 0.999. De balanserar hur mycket nya respektive äldre gradienter ska räknas.

Bias-korrigering

Medelvärdena börjar på noll, så de tidiga stegen ser för små ut. Adam använder en bias correction för att rätta till detta, så att uppdateringarna blir rimliga redan från första steget.

Använd det i PyTorch

En enda rad ger dig Adam. Den förvalda learning rate på 0.001 fungerar bra för ett enormt spann av modeller, vilket är anledningen till att den är så populär.

opt = torch.optim.Adam(model.parameters(), lr=1e-3)

Adams brist med weight decay

Klassisk Adam blandar in weight decay i gradienten, där den adaptiva skalningen förvränger den. Regulariseringen blir därmed svagare än du avsåg.

AdamW löser det

AdamW kopplar bort weight decay från gradientsteget och tillämpar den direkt på vikterna. Avklingningen fungerar nu som en ren och förutsägbar krympning.

opt = torch.optim.AdamW(model.parameters(), lr=1e-3, weight_decay=0.01)

Det moderna standardvalet

För transformers och de flesta stora modeller är AdamW standardvalet. Välj det först när du vill ha snabb och tillförlitlig konvergens.

Adaptiv, men med förbehåll

Adam tränar ofta snabbare än SGD, men vanlig SGD med momentum kan generalisera bättre vid visionsuppgifter. Prova båda när noggrannheten verkligen är viktig.

Snabbkontroll

Fastställ skillnaden mellan Adam och AdamW.

Sammanfattning

Adam anpassar inlärningsfrekvensen per vikt med hjälp av gradientens medelvärde och varians, medan AdamW använder en fast viktavklingning. AdamW är dagens förstahandsval av optimerare. ⚙️

Gratis att börja

Lär dig Python med en AI-lärare – gratis

Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.

Kurser
30
Lektioner
120

Vanliga frågor

Är lektionen ”Adam och AdamW förklarade” gratis?

Ja – hela texten till ”Adam och AdamW förklarade” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i Deep Learning Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i Deep Learning Academy innehåller totalt 4 lektioner.

Vad lär jag mig i ”Adam och AdamW förklarade”?

Adaptiva hastigheter plus frikopplad viktdecay Ni övar på Deep Learning Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.

Behöver jag någon erfarenhet för att börja lära mig Deep Learning Academy?

Du behöver inga förkunskaper. Utbildningen i Deep Learning Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 2 av 4.

Hur lång tid tar lektionen ”Adam och AdamW förklarade”?

De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.

Kan jag skriva och köra kod i den här Deep Learning Academy-lektionen?

Ja. Varje Deep Learning Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.

Alla lektioner i den här kursen

  1. SGD med momentum
  2. Adam och AdamW förklarade
  3. Weight decay kontra L2-regularisering
  4. Scheman för inlärningshastighet och warmup
← Tillbaka till Deep Learning Academy