Deep Learning Academy · Les

Weight decay versus L2-regularisatie

Het subtiele verschil dat ertoe doet.

Les 3 van 413 stappen

Weight decay versus L2-regularisatie is een gratis Deep Learning Academy-les op CoddyKit. Dit is les 3 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Deep Learning Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Deep Learning Academy bevat in totaal 4 lessen.

Houd gewichten klein

Grote gewichten wijzen vaak op een overfit model. Zowel weight decay als L2-regularisatie duwen gewichten richting nul, zodat het netwerk eenvoudiger blijft.

L2 wordt bij de verliesfunctie opgeteld

L2-regularisatie voegt een strafterm, de som van de gekwadrateerde gewichten, rechtstreeks aan de verliesfunctie toe. De verliesfunctie minimaliseren betekent dan ook dat de gewichten kleiner worden.

loss = data_loss + lam * (w ** 2).sum()

Verval verkleint rechtstreeks

Weight decay slaat de verliesfunctie over en vermenigvuldigt elk gewicht in elke stap met een getal dat iets kleiner is dan één. De gewichten worden daardoor verkleind voordat de gradiëntupdate plaatsvindt.

w = w - lr * grad - lr * wd * w

Hetzelfde geldt voor SGD

Bij gewone SGD zijn de twee wiskundig identiek. De gradiënt van de L2-strafterm is precies de vervalterm, dus in de praktijk maakt dat geen verschil.

Adam maakt het verschil

Het verschil wordt zichtbaar bij Adam. De schaling per gewicht deelt de L2-gradiënt ongelijkmatig, waardoor L2 en echt weight decay niet langer gelijk zijn.

Waarom het vervormt

Adam verkleint gewichten met grote gradiënten minder en gewichten met kleine gradiënten meer. Ingebouwde L2-regularisatie neemt die vertekening over, waardoor de regularisatie juist daar zwakker wordt waar je die nodig hebt.

Ontkoppelen is de oplossing

AdamW past ontkoppelde weight decay toe en verkleint elk gewicht met dezelfde fractie, onafhankelijk van de gradiënt. Zo werkt de regularisatie weer zoals bedoeld.

Stel het in PyTorch in

Het argument weight_decay bepaalt de sterkte. In AdamW is dit echt ontkoppelde weight decay, wat je meestal wilt.

opt = torch.optim.AdamW(model.parameters(), lr=1e-3, weight_decay=0.01)

Kies een sterkte

Waarden zoals 0.01 of 0.0001 zijn gebruikelijk. Te veel weight decay leidt tot underfitting; te weinig laat gewichten groeien en veroorzaakt overfitting. Stem deze waarde af zoals elke hyperparameter.

Spaar de biaswaarden

Het is gebruikelijk om weight decay over te slaan voor bias- en normalisatieparameters. Ze verkleinen helpt zelden en kan de manier waarop het model leert ongemerkt verslechteren.

De kern

Bij SGD kun je beide benamingen zonder bezwaar gebruiken. Bij adaptieve optimizers heeft AdamW de voorkeur, zodat weight decay zich gedraagt zoals bedoeld.

Korte controle

Test wanneer de twee echt van elkaar afwijken.

Samenvatting

L2 voegt een strafterm toe aan de verliesfunctie; weight decay verkleint gewichten rechtstreeks. Ze zijn gelijk bij SGD, maar verschillen bij Adam. Daarom ontkoppelt AdamW weight decay. 🪶

Gratis beginnen

Leer Python met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
30
Lessen
120

Veelgestelde vragen

Is de les “Weight decay versus L2-regularisatie” gratis?

Ja — de volledige tekst van “Weight decay versus L2-regularisatie” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus Deep Learning Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus Deep Learning Academy bevat in totaal 4 lessen.

Wat leer ik in “Weight decay versus L2-regularisatie”?

Het subtiele verschil dat ertoe doet. Je oefent met Deep Learning Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met Deep Learning Academy te beginnen?

Ervaring vooraf is niet nodig. Deep Learning Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 3 van 4.

Hoe lang duurt de les “Weight decay versus L2-regularisatie”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over Deep Learning Academy?

Ja. Elke les over Deep Learning Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. SGD met momentum
  2. Adam en AdamW uitgelegd
  3. Weight decay versus L2-regularisatie
  4. Learning-rate-schema's en warmup
← Terug naar Deep Learning Academy