0Pricing
Deep Learning Academy · Pelajaran

Adam dan AdamW Dijelaskan

Laju adaptif ditambah peluruhan bobot yang dipisahkan

Adam dan AdamW Dijelaskan adalah pelajaran Deep Learning Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Deep Learning Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Deep Learning Academy mencakup 4 pelajaran total.

Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.

One Rate Per Weight

SGD uses a single learning rate for every parameter. Adam adapts the step size for each weight on its own, based on that weight's gradient history.

Two Moving Averages

Adam tracks two running averages: the mean of gradients and the mean of their squares. Together they form the first and second moments.

First Moment Is Momentum

The first moment is basically momentum, the smoothed average of recent gradients. It decides the overall direction each weight should move.

Second Moment Scales Steps

The second moment estimates each gradient's size. Adam divides by its square root, so noisy weights take smaller steps and quiet ones take larger.

The Betas

Two decay rates, the betas, control those averages, typically 0.9 and 0.999. They balance how much recent versus older gradients matter.

Bias Correction

The averages start at zero, so early steps look too small. Adam applies a bias correction to fix this so updates are sane from step one.

Use It in PyTorch

One line gives you Adam. The default learning rate of 0.001 works well across a huge range of models, which is why it is so popular.

opt = torch.optim.Adam(model.parameters(), lr=1e-3)

Adam's Weight Decay Flaw

Classic Adam mixes weight decay into the gradient, where the adaptive scaling distorts it. The regularization ends up weaker than you intended.

AdamW Fixes It

AdamW decouples weight decay from the gradient step and applies it directly to the weights. The decay now works as a clean, predictable shrink.

opt = torch.optim.AdamW(model.parameters(), lr=1e-3, weight_decay=0.01)

The Modern Default

For transformers and most large models, AdamW is the standard choice. Reach for it first whenever you want fast, reliable convergence.

Adaptive, With Caveats

Adam often trains faster than SGD, yet plain SGD with momentum can generalize better on vision tasks. Try both when accuracy really counts.

Quick Check

Pin down the Adam to AdamW difference.

Recap

Adam adapts a learning rate per weight using gradient mean and variance, while AdamW fixes its weight decay. AdamW is today's go-to optimizer. ⚙️

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Adam dan AdamW Dijelaskan” gratis?

Ya — teks lengkap “Adam dan AdamW Dijelaskan” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Deep Learning Academy, upgrade ke CoddyKit PRO. Kursus Deep Learning Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Adam dan AdamW Dijelaskan”?

Laju adaptif ditambah peluruhan bobot yang dipisahkan Kamu berlatih Deep Learning Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai Deep Learning Academy?

Tidak diperlukan pengalaman sebelumnya. Deep Learning Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.

Berapa lama pelajaran “Adam dan AdamW Dijelaskan” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran Deep Learning Academy ini?

Ya. Setiap pelajaran Deep Learning Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. SGD dengan Momentum
  2. Adam dan AdamW Dijelaskan
  3. Peluruhan Bobot vs Regularisasi L2
  4. Jadwal Laju Pembelajaran dan Warmup
← Kembali ke Deep Learning Academy