SGD mit Momentum
Glätten Sie Updates, um Rauschen zu überwinden.
SGD mit Momentum ist eine kostenlose Deep Learning Academy-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Deep Learning Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Deep Learning Academy-Kurs umfasst insgesamt 4 Lektionen.
Einfaches SGD vergisst
Vanilla-SGD führt Schritte nur anhand des aktuellen Gradienten aus. Jede Aktualisierung beginnt von vorn, sodass eine verrauschte Steigung es zum Schwanken bringt und nur langsam zum Minimum führt.
Etwas Trägheit nutzen
Momentum gibt SGD ein Gedächtnis. Es bildet einen gleitenden Mittelwert vergangener Gradienten und bewegt sich in diese Richtung – wie ein Ball, der bergab immer schneller wird.
Der Geschwindigkeitsvektor
Momentum verfolgt eine velocity, die die alte Geschwindigkeit mit dem neuen Gradienten verbindet. Die Gewichte bewegen sich bei jedem Schritt um diese geglättete Geschwindigkeit.
v = beta * v + grad
w = w - lr * vDer Beta-Regler
Der Momentum-Koeffizient beta legt fest, wie stark vergangene Schritte berücksichtigt werden. Ein üblicher Wert ist 0.9, sodass der größte Teil der Geschwindigkeit übernommen wird.
Glättet Rauschen
Da Momentum viele Gradienten mittelt, hebt sich zufälliges Rauschen in einzelnen Batches größtenteils auf. Der Weg zum Minimum wird glatter und gleichmäßiger.
Überwindet kleine Unebenheiten
Die aufgebaute Geschwindigkeit lässt den Optimierer über kleine Täler und flache Stellen hinwegrollen, an denen einfaches SGD ins Stocken geraten würde. Der Ball bleibt nicht an jedem Kieselstein stehen.
In PyTorch aktivieren
Sie müssen das nicht von Hand programmieren. Übergeben Sie einfach momentum an den integrierten SGD-Optimierer, und PyTorch verfolgt die Geschwindigkeit für Sie.
opt = torch.optim.SGD(model.parameters(), lr=0.01, momentum=0.9)Nesterov blickt voraus
Eine ausgefeiltere Variante ist das Nesterov-Momentum. Es prüft, wohin sich die Geschwindigkeit bewegt, bevor es den Gradienten misst. Dadurch konvergiert es oft etwas schneller.
opt = torch.optim.SGD(model.parameters(), lr=0.01, momentum=0.9, nesterov=True)Achten Sie auf das Überschwingen
Zu viel Geschwindigkeit kann Sie über den Talboden hinaus tragen. Wenn der Loss schwankt oder divergiert, senken Sie die learning rate oder reduzieren Sie das Momentum etwas.
Warum es weiterhin wichtig ist
Auch angesichts ausgefeilter Optimierer bleibt SGD with momentum eine starke Baseline und generalisiert bei Vision-Modellen oft hervorragend.
Ein schnellerer Abstieg
Der Vorteil ist deutlich: Mit Momentum wird ein gutes Minimum meist in weniger Epochen erreicht als mit einfachem SGD, und der Weg dorthin verläuft mit weniger Zickzackbewegungen.
Kurze Überprüfung
Stellen Sie sicher, dass die Rolle von Momentum klar ist.
Zusammenfassung
Momentum gibt SGD eine Geschwindigkeit, die vergangene Gradienten verbindet, Rauschen glättet und über kleine Unebenheiten hinwegrollt. Setzen Sie Momentum auf etwa 0.9, um schneller und gleichmäßiger abzusteigen. 🏂
Lerne Python mit einem KI-Tutor — kostenlos
Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.
- Kurse
- 30
- Lektionen
- 120
Häufig gestellte Fragen
Ist die Lektion „SGD mit Momentum“ kostenlos?
Ja — der vollständige Text von „SGD mit Momentum“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Deep Learning Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Deep Learning Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „SGD mit Momentum“?
Glätten Sie Updates, um Rauschen zu überwinden. Du übst Deep Learning Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um Deep Learning Academy zu starten?
Keine Vorkenntnisse erforderlich. Deep Learning Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.
Wie lange dauert die Lektion „SGD mit Momentum“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser Deep Learning Academy-Lektion Code schreiben und ausführen?
Ja. Jede Deep Learning Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.