0Pricing
Deep Learning Academy · Leçon

Accumulation des gradients pour les gros lots

Simulez de gros lots sur de petits GPU.

Accumulation des gradients pour les gros lots est une leçon Deep Learning Academy gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Deep Learning Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Deep Learning Academy comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

The Big-Batch Problem

Large batches often train more smoothly, but they also need lots of GPU memory. A small card simply cannot hold a giant batch at once.

The Core Trick

Gradient accumulation splits one big batch into small chunks. You add up their gradients and update once, as if the whole batch ran together.

Gradients Already Accumulate

PyTorch adds each backward pass into .grad rather than replacing it. This default behavior is exactly what accumulation relies on.

Pick an Accumulation Count

Choose how many mini-batches make one update. With accum_steps of four, four small batches behave like one batch four times larger.

accum_steps = 4

Do Not Zero Every Step

The key change is timing: zero_grad only at the start of an accumulation cycle, not after every single mini-batch.

if step % accum_steps == 0:
    optimizer.zero_grad()

Scale the Loss

Divide each mini-batch loss by accum_steps before backward. This keeps the average gradient identical to running the full batch at once.

loss = loss_fn(model(x), y) / accum_steps
loss.backward()

Step Only When Full

After enough mini-batches pile up, call optimizer.step. The accumulated gradients now reflect the whole large batch.

if (step + 1) % accum_steps == 0:
    optimizer.step()

The Full Pattern

Put it together: scale the loss, backward every step, but only step and zero once per cycle. The loop stays simple.

for step, (x, y) in enumerate(loader):
    loss = loss_fn(model(x), y) / accum_steps
    loss.backward()
    if (step + 1) % accum_steps == 0:
        optimizer.step()
        optimizer.zero_grad()

Memory Stays Small

You only ever hold one mini-batch in memory at a time. That is why a modest GPU can mimic a batch many times its real capacity.

The Trade-Off

Accumulation trades time for memory: more forward and backward passes per update mean each effective batch takes a little longer to finish.

Mind Batch Norm

Batch norm still sees only the small mini-batch, so its statistics are noisier than a true large batch would produce. Keep that in mind.

Quick Check

You accumulate over 4 mini-batches. When should you call optimizer.step()?

Recap

Split a big batch into chunks, divide the loss by accum_steps, backward every chunk, and step only once per cycle to fake a large batch on small memory. 🧮

Questions Fréquemment Posées

La leçon « Accumulation des gradients pour les gros lots » est-elle gratuite ?

Oui — le texte complet de « Accumulation des gradients pour les gros lots » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Deep Learning Academy, passe à CoddyKit PRO. Le cours Deep Learning Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Accumulation des gradients pour les gros lots » ?

Simulez de gros lots sur de petits GPU. Tu pratiques Deep Learning Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer Deep Learning Academy ?

Aucune expérience préalable n'est requise. Deep Learning Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.

Combien de temps prend la leçon « Accumulation des gradients pour les gros lots » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon Deep Learning Academy ?

Oui. Chaque leçon Deep Learning Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Précision mixte avec autocast et GradScaler
  2. Accumulation des gradients pour les gros lots
  3. Analyser le goulet d’étranglement
  4. Réduire l’utilisation de la mémoire du GPU
← Retour à Deep Learning Academy