0Pricing
Deep Learning Academy · Урок

Масштабированное скалярное произведение и несколько голов

Выполняйте attention параллельно в отдельных подпространствах

«Масштабированное скалярное произведение и несколько голов» — бесплатный урок Deep Learning Academy на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Deep Learning Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Deep Learning Academy содержит 4 уроков всего.

Части этого урока еще не переведены и отображаются на английском.

The Scaling Problem

When key vectors are long, dot-product scores grow huge and softmax becomes razor-sharp. That kills gradients, so we need to scale the scores down.

Divide by Root d

The fix is to divide each score by the square root of the key dimension. This keeps the numbers in a stable range before softmax.

scores = (q @ k.transpose(-2, -1)) / d_k ** 0.5

Scaled Dot-Product Attention

Put it together: score, scale, softmax, then blend values. This four-step recipe is the famous scaled dot-product attention.

w = scores.softmax(dim=-1)
out = w @ v

One Head, One View

A single attention head learns just one way to relate tokens. But language has many relationships at once, so one head is limiting.

Many Heads in Parallel

Multi-head attention runs several attention heads side by side, each with its own Q, K, V projections, each attending in a different subspace.

Split the Dimension

You do not make the model wider. You split the model dimension across heads, so each head works on a smaller slice in parallel.

d_head = d_model // num_heads

Reshape into Heads

To run heads in parallel, you reshape Q, K, V to add a heads axis, then attend within each head independently.

q = q.view(B, T, H, d_head).transpose(1, 2)

Different Patterns

One head may track grammar, another may link a pronoun to its noun. Multiple heads capture diverse patterns the same input contains.

Concatenate Heads

After each head produces its output, you concatenate them back into one vector of the original model dimension.

out = out.transpose(1, 2).reshape(B, T, d_model)

Final Projection

A last output projection mixes the concatenated head results, letting the model combine what every head discovered.

out = self.W_o(out)

Use the Built-in

In practice PyTorch ships nn.MultiheadAttention, so you rarely hand-roll the reshapes. Knowing the math still helps you debug.

attn = nn.MultiheadAttention(d_model, num_heads)

Quick Check

Let's confirm why we scale the scores.

Recap

You saw how scaling stabilizes softmax and how multi-head attention splits the work across parallel heads, then concatenates and projects. Great progress!

Часто задаваемые вопросы

Урок «Масштабированное скалярное произведение и несколько голов» бесплатный?

Да — полный текст урока «Масштабированное скалярное произведение и несколько голов» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Deep Learning Academy, подпишись на CoddyKit PRO. Курс Deep Learning Academy содержит 4 уроков всего.

Чему я научусь в уроке «Масштабированное скалярное произведение и несколько голов»?

Выполняйте attention параллельно в отдельных подпространствах Ты практикуешь Deep Learning Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать Deep Learning Academy?

Предыдущий опыт не требуется. Deep Learning Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.

Сколько времени занимает урок «Масштабированное скалярное произведение и несколько голов»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке Deep Learning Academy?

Да. Каждый урок Deep Learning Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Self-attention: запрос, ключ и значение
  2. Масштабированное скалярное произведение и несколько голов
  3. Позиционное кодирование порядка
  4. Соберите блок энкодера Transformer
← Назад к Deep Learning Academy