Deep Learning Academy · Lektion

SGD mit Momentum

Glätten Sie Updates, um Rauschen zu überwinden.

Lektion 1 von 413 Schritte

SGD mit Momentum ist eine kostenlose Deep Learning Academy-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Deep Learning Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Deep Learning Academy-Kurs umfasst insgesamt 4 Lektionen.

Einfaches SGD vergisst

Vanilla-SGD führt Schritte nur anhand des aktuellen Gradienten aus. Jede Aktualisierung beginnt von vorn, sodass eine verrauschte Steigung es zum Schwanken bringt und nur langsam zum Minimum führt.

Etwas Trägheit nutzen

Momentum gibt SGD ein Gedächtnis. Es bildet einen gleitenden Mittelwert vergangener Gradienten und bewegt sich in diese Richtung – wie ein Ball, der bergab immer schneller wird.

Der Geschwindigkeitsvektor

Momentum verfolgt eine velocity, die die alte Geschwindigkeit mit dem neuen Gradienten verbindet. Die Gewichte bewegen sich bei jedem Schritt um diese geglättete Geschwindigkeit.

v = beta * v + grad
w = w - lr * v

Der Beta-Regler

Der Momentum-Koeffizient beta legt fest, wie stark vergangene Schritte berücksichtigt werden. Ein üblicher Wert ist 0.9, sodass der größte Teil der Geschwindigkeit übernommen wird.

Glättet Rauschen

Da Momentum viele Gradienten mittelt, hebt sich zufälliges Rauschen in einzelnen Batches größtenteils auf. Der Weg zum Minimum wird glatter und gleichmäßiger.

Überwindet kleine Unebenheiten

Die aufgebaute Geschwindigkeit lässt den Optimierer über kleine Täler und flache Stellen hinwegrollen, an denen einfaches SGD ins Stocken geraten würde. Der Ball bleibt nicht an jedem Kieselstein stehen.

In PyTorch aktivieren

Sie müssen das nicht von Hand programmieren. Übergeben Sie einfach momentum an den integrierten SGD-Optimierer, und PyTorch verfolgt die Geschwindigkeit für Sie.

opt = torch.optim.SGD(model.parameters(), lr=0.01, momentum=0.9)

Nesterov blickt voraus

Eine ausgefeiltere Variante ist das Nesterov-Momentum. Es prüft, wohin sich die Geschwindigkeit bewegt, bevor es den Gradienten misst. Dadurch konvergiert es oft etwas schneller.

opt = torch.optim.SGD(model.parameters(), lr=0.01, momentum=0.9, nesterov=True)

Achten Sie auf das Überschwingen

Zu viel Geschwindigkeit kann Sie über den Talboden hinaus tragen. Wenn der Loss schwankt oder divergiert, senken Sie die learning rate oder reduzieren Sie das Momentum etwas.

Warum es weiterhin wichtig ist

Auch angesichts ausgefeilter Optimierer bleibt SGD with momentum eine starke Baseline und generalisiert bei Vision-Modellen oft hervorragend.

Ein schnellerer Abstieg

Der Vorteil ist deutlich: Mit Momentum wird ein gutes Minimum meist in weniger Epochen erreicht als mit einfachem SGD, und der Weg dorthin verläuft mit weniger Zickzackbewegungen.

Kurze Überprüfung

Stellen Sie sicher, dass die Rolle von Momentum klar ist.

Zusammenfassung

Momentum gibt SGD eine Geschwindigkeit, die vergangene Gradienten verbindet, Rauschen glättet und über kleine Unebenheiten hinwegrollt. Setzen Sie Momentum auf etwa 0.9, um schneller und gleichmäßiger abzusteigen. 🏂

Kostenlos starten

Lerne Python mit einem KI-Tutor — kostenlos

Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.

Kurse
30
Lektionen
120

Häufig gestellte Fragen

Ist die Lektion „SGD mit Momentum“ kostenlos?

Ja — der vollständige Text von „SGD mit Momentum“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Deep Learning Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Deep Learning Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „SGD mit Momentum“?

Glätten Sie Updates, um Rauschen zu überwinden. Du übst Deep Learning Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Deep Learning Academy zu starten?

Keine Vorkenntnisse erforderlich. Deep Learning Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.

Wie lange dauert die Lektion „SGD mit Momentum“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Deep Learning Academy-Lektion Code schreiben und ausführen?

Ja. Jede Deep Learning Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. SGD mit Momentum
  2. Adam und AdamW erklärt
  3. Weight Decay vs. L2-Regularisierung
  4. Lernratenpläne und Warmup
← Zurück zu Deep Learning Academy