0Pricing
Deep Learning Academy · Lección

La pasada hacia delante guarda datos que reutiliza la retropropagación

Por qué las activaciones se almacenan durante la pasada hacia delante

La pasada hacia delante guarda datos que reutiliza la retropropagación es una lección gratuita de Deep Learning Academy en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Deep Learning Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Deep Learning Academy incluye 4 lecciones en total.

Partes de esta lección aún no han sido traducidas y se muestran en inglés.

Two Passes, One Goal

Training each batch runs two passes: a forward pass to predict and compute loss, then a backward pass to compute gradients. They work as a pair.

The Forward Pass Computes Values

Going forward, each layer turns its input into an output and sends it onward. By the end you have a prediction and a single loss number.

Backward Needs Forward Values

To compute a layer's gradient, the chain rule needs the very activations that layer produced going forward. Those values are not optional.

So We Cache Them

During the forward pass the network quietly caches each layer's inputs and outputs in memory, ready for the backward pass to grab. 💾

A Concrete Example

The derivative of a layer often reuses its own output. For a sigmoid, the gradient depends on the saved output value, so caching it saves recomputation.

sigmoid_grad = saved_output * (1 - saved_output)

Backward Reuses the Cache

The backward pass walks layers in reverse, and at each one it pulls the matching cached values to multiply into the gradient. Nothing is recomputed.

Cache Costs Memory

Storing every activation is why training a deep net uses far more memory than just running it for predictions. Bigger nets need bigger caches.

Inference Skips the Cache

When you only need predictions, there is no backward pass, so PyTorch skips the cache entirely. That is why inference is lighter on memory.

with torch.no_grad():
    preds = model(x)

PyTorch Does This for You

Every operation on a tensor with requires_grad records what it needs into the computation graph, building the cache automatically as you go.

One Backward Frees It

By default, calling backward() consumes the cached graph and frees it. That is why a second backward() on the same graph raises an error.

loss.backward()

Why This Design Wins

Caching forward values means each gradient is one cheap lookup-and-multiply instead of a fresh recomputation, making backprop fast and exact.

Quick Check

Let's check the cache idea.

Recap

The forward pass caches activations, and the backward pass reuses them to build gradients. That trade of memory for speed is what makes backprop practical. 💾

Preguntas frecuentes

¿La lección «La pasada hacia delante guarda datos que reutiliza la retropropagación» es gratis?

Sí — el texto completo de «La pasada hacia delante guarda datos que reutiliza la retropropagación» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Deep Learning Academy, actualiza a CoddyKit PRO. El curso de Deep Learning Academy incluye 4 lecciones en total.

¿Qué aprenderé en «La pasada hacia delante guarda datos que reutiliza la retropropagación»?

Por qué las activaciones se almacenan durante la pasada hacia delante Practicas Deep Learning Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar Deep Learning Academy?

No se requiere experiencia previa. Deep Learning Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.

¿Cuánto tiempo toma la lección «La pasada hacia delante guarda datos que reutiliza la retropropagación»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de Deep Learning Academy?

Sí. Cada lección de Deep Learning Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. La regla de la cadena, capa por capa
  2. La pasada hacia delante guarda datos que reutiliza la retropropagación
  3. Haga la retropropagación de una red diminuta a mano
  4. Gradientes desvanecidos y explosivos
← Volver a Deep Learning Academy