0Pricing
Deep Learning Academy · Ders

Ölçeklendirilmiş Nokta Çarpımı ve Çok Başlılık

Paralel alt uzaylarda dikkat uygulayın.

Ölçeklendirilmiş Nokta Çarpımı ve Çok Başlılık, CoddyKit'te ücretsiz bir Deep Learning Academy dersidir. Bu, 4 dersinin 2. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, Deep Learning Academy öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. Deep Learning Academy kursu toplamda 4 dersten oluşur.

Bu dersin bazı bölümleri henüz çevrilmemiş olup İngilizce olarak gösterilmektedir.

The Scaling Problem

When key vectors are long, dot-product scores grow huge and softmax becomes razor-sharp. That kills gradients, so we need to scale the scores down.

Divide by Root d

The fix is to divide each score by the square root of the key dimension. This keeps the numbers in a stable range before softmax.

scores = (q @ k.transpose(-2, -1)) / d_k ** 0.5

Scaled Dot-Product Attention

Put it together: score, scale, softmax, then blend values. This four-step recipe is the famous scaled dot-product attention.

w = scores.softmax(dim=-1)
out = w @ v

One Head, One View

A single attention head learns just one way to relate tokens. But language has many relationships at once, so one head is limiting.

Many Heads in Parallel

Multi-head attention runs several attention heads side by side, each with its own Q, K, V projections, each attending in a different subspace.

Split the Dimension

You do not make the model wider. You split the model dimension across heads, so each head works on a smaller slice in parallel.

d_head = d_model // num_heads

Reshape into Heads

To run heads in parallel, you reshape Q, K, V to add a heads axis, then attend within each head independently.

q = q.view(B, T, H, d_head).transpose(1, 2)

Different Patterns

One head may track grammar, another may link a pronoun to its noun. Multiple heads capture diverse patterns the same input contains.

Concatenate Heads

After each head produces its output, you concatenate them back into one vector of the original model dimension.

out = out.transpose(1, 2).reshape(B, T, d_model)

Final Projection

A last output projection mixes the concatenated head results, letting the model combine what every head discovered.

out = self.W_o(out)

Use the Built-in

In practice PyTorch ships nn.MultiheadAttention, so you rarely hand-roll the reshapes. Knowing the math still helps you debug.

attn = nn.MultiheadAttention(d_model, num_heads)

Quick Check

Let's confirm why we scale the scores.

Recap

You saw how scaling stabilizes softmax and how multi-head attention splits the work across parallel heads, then concatenates and projects. Great progress!

Sıkça Sorulan Sorular

“Ölçeklendirilmiş Nokta Çarpımı ve Çok Başlılık” dersi ücretsiz mi?

Evet — “Ölçeklendirilmiş Nokta Çarpımı ve Çok Başlılık” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve Deep Learning Academy kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. Deep Learning Academy kursu toplamda 4 dersten oluşur.

“Ölçeklendirilmiş Nokta Çarpımı ve Çok Başlılık” dersinde ne öğreneceğim?

Paralel alt uzaylarda dikkat uygulayın. Deep Learning Academy ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.

Deep Learning Academy öğrenmeye başlamak için deneyim gerekli mi?

Önceden deneyim gerekmez. CoddyKit'te Deep Learning Academy, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 2. dersidir.

“Ölçeklendirilmiş Nokta Çarpımı ve Çok Başlılık” dersi ne kadar sürer?

Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.

Bu Deep Learning Academy dersinde kod yazıp çalıştırabilir miyim?

Evet. Her Deep Learning Academy dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.

Bu kursun tüm dersleri

  1. Kendine Dikkat: Sorgu, Anahtar ve Değer
  2. Ölçeklendirilmiş Nokta Çarpımı ve Çok Başlılık
  3. Sıra için Konumsal Kodlama
  4. Bir Transformer Kodlayıcı Bloğu Oluşturma
← Deep Learning Academy Sayfasına Dön