0Pricing
Deep Learning Academy · Урок

Кэширование при прямом проходе и повторное использование при обратном

Почему активации сохраняются во время прямого прохода

«Кэширование при прямом проходе и повторное использование при обратном» — бесплатный урок Deep Learning Academy на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Deep Learning Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Deep Learning Academy содержит 4 уроков всего.

Части этого урока еще не переведены и отображаются на английском.

Two Passes, One Goal

Training each batch runs two passes: a forward pass to predict and compute loss, then a backward pass to compute gradients. They work as a pair.

The Forward Pass Computes Values

Going forward, each layer turns its input into an output and sends it onward. By the end you have a prediction and a single loss number.

Backward Needs Forward Values

To compute a layer's gradient, the chain rule needs the very activations that layer produced going forward. Those values are not optional.

So We Cache Them

During the forward pass the network quietly caches each layer's inputs and outputs in memory, ready for the backward pass to grab. 💾

A Concrete Example

The derivative of a layer often reuses its own output. For a sigmoid, the gradient depends on the saved output value, so caching it saves recomputation.

sigmoid_grad = saved_output * (1 - saved_output)

Backward Reuses the Cache

The backward pass walks layers in reverse, and at each one it pulls the matching cached values to multiply into the gradient. Nothing is recomputed.

Cache Costs Memory

Storing every activation is why training a deep net uses far more memory than just running it for predictions. Bigger nets need bigger caches.

Inference Skips the Cache

When you only need predictions, there is no backward pass, so PyTorch skips the cache entirely. That is why inference is lighter on memory.

with torch.no_grad():
    preds = model(x)

PyTorch Does This for You

Every operation on a tensor with requires_grad records what it needs into the computation graph, building the cache automatically as you go.

One Backward Frees It

By default, calling backward() consumes the cached graph and frees it. That is why a second backward() on the same graph raises an error.

loss.backward()

Why This Design Wins

Caching forward values means each gradient is one cheap lookup-and-multiply instead of a fresh recomputation, making backprop fast and exact.

Quick Check

Let's check the cache idea.

Recap

The forward pass caches activations, and the backward pass reuses them to build gradients. That trade of memory for speed is what makes backprop practical. 💾

Часто задаваемые вопросы

Урок «Кэширование при прямом проходе и повторное использование при обратном» бесплатный?

Да — полный текст урока «Кэширование при прямом проходе и повторное использование при обратном» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Deep Learning Academy, подпишись на CoddyKit PRO. Курс Deep Learning Academy содержит 4 уроков всего.

Чему я научусь в уроке «Кэширование при прямом проходе и повторное использование при обратном»?

Почему активации сохраняются во время прямого прохода Ты практикуешь Deep Learning Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать Deep Learning Academy?

Предыдущий опыт не требуется. Deep Learning Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.

Сколько времени занимает урок «Кэширование при прямом проходе и повторное использование при обратном»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке Deep Learning Academy?

Да. Каждый урок Deep Learning Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Правило цепочки, слой за слоем
  2. Кэширование при прямом проходе и повторное использование при обратном
  3. Выполните обратное распространение в маленькой сети вручную
  4. Затухающие и взрывающиеся градиенты
← Назад к Deep Learning Academy