Transformer'lar ve Dikkat Mekanizması: Sade Bir Anlatım
Dikkat mekanizmalarının, matematiği anlamaya gerek kalmadan modellerin ilgili bağlama odaklanmasını nasıl sağladığını inceleyerek transformer mimarisinin gizemini çözün.
Transformer'lar ve Dikkat Mekanizması: Sade Bir Anlatım, CoddyKit'te ücretsiz bir AI Engineering Academy dersidir. Bu, 4 dersinin 2. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Engineering Academy öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Engineering Academy kursu toplamda 4 dersten oluşur.
Temel Sorun: Uzun Menzilli Bağımlılıklar
"Kupa, o çok büyük olduğu için çantaya sığmadı" cümlesinde "o" neyi ifade ediyor? Eski modeller uzun cümlelerde bağlantıyı kaybediyordu. Buna uzun menzilli bağımlılık sorunu denir.
Ağırlıklı Odaklanma Olarak Dikkat
Dikkat, bir modelin her kelime için hangi kelimelerin en önemli olduğuna karar verme biçimidir — bir metindeki önemli kısımları vurgulamak ve her kelimeye aynı şekilde davranmamak gibidir.
Sorgular, Anahtarlar ve Değerler
Dikkat, arama gibi çalışır: her kelime bir Sorgu gönderir, bunu her Anahtar ile karşılaştırır ve en alakalı Değerleri alır. Aşağıdaki kod temel fikri gösterir.
# Simplified self-attention in pseudocode
import numpy as np
def scaled_dot_product_attention(Q, K, V):
d_k = Q.shape[-1] # dimension of keys
scores = Q @ K.T / np.sqrt(d_k) # scale to prevent vanishing gradients
weights = np.exp(scores) / np.sum(np.exp(scores), axis=-1, keepdims=True) # softmax
output = weights @ V # weighted sum of values
return outputÇok Başlı Dikkat: Birden Çok Bakış Açısı
Tek bir dikkat başlığı, tek türde bir bağlantıyı yakalar. Çok başlı dikkat, aynı anda birçok başlık çalıştırır; böylece model kelimeleri aynı anda çeşitli merceklerden görür.
Konumsal Kodlamalar: Kelime Sırasını Eklemek
Dikkat tek başına kelimelerin sırasını göz ardı eder — "köpek adamı ısırır" ile "adam köpeği ısırır" aynı görünür. Konumsal kodlamalar, sıranın kaybolmaması için konum bilgisini ekler.
Dikkatten Sonra İleri Beslemeli Katmanlar
Dikkat bağlamı paylaştıktan sonra bir ileri beslemeli ağ her kelimeyi kendi başına işler. İlginçtir ki modelin gerçeklere dayalı bilgisinin büyük bir kısmı burada bulunuyor gibi görünür.
Yalnızca Kodlayıcı ve Yalnızca Kod Çözücü Modeller
Yalnızca kodlayıcı BERT tarzı modeller, metni anlamak için tamamını aynı anda okur. Yalnızca kod çözücü GPT tarzı modeller ise metni üretmek için soldan sağa okur — ChatGPT'nin yaptığı da budur.
Katmanların Üst Üste Eklenmesi ve Derinlik
Modern LLM'ler onlarca Transformer bloğunu üst üste ekler. Her katman bir öncekini geliştirir — ilk katmanlar dil bilgisini yakalar, daha derin katmanlar akıl yürütmeyi ele alır. Daha fazla derinlik, daha fazla düşünme demektir.
Artık Bağlantılar ve Katman Normalizasyonu
Çok sayıda katmanı üst üste eklemek zordur. Artık bağlantılar ve katman normalizasyonu sinyali kararlı tutar; böylece derin modeller 100'den fazla katmanda güvenilir biçimde eğitilebilir.
Dikkat Neden Bu Kadar İyi Ölçeklenir
Dikkati paralel çalıştırmak kolaydır; bu nedenle daha fazla GPU daha hızlı eğitim anlamına gelir. Araştırmacılar bu şekilde çok büyük verilerle eğitim yaptı ve ünlü ölçekleme yasalarını keşfetti.
FlashAttention ve Modern İyileştirmeler
Uzun girdiler, standart dikkatin çok fazla bellek kullanmasına neden olur. FlashAttention aynı sonucu çok daha verimli hesaplar ve büyük bağlam pencerelerini pratik hâle getirir.
Hızlı Kontrol
Bu dersteki Yapay Zekâ Mühendisliği kavramlarını anlayıp anlamadığınızı test edin.
Ders Özeti
Özet: öz-dikkat her kelimeyi diğer tüm kelimelere bağlar, çok başlı dikkat birçok ilişkiyi aynı anda yakalar ve artık bağlantılarla normalizasyon modellerin derinleşmesini sağlar. Sırada: LLM'lerin nasıl eğitildiği var.
Yapay zeka eğitmeniyle Python öğren — ücretsiz
Tarayıcında gerçek kod yaz ve çalıştır, 7/24 yapay zeka eğitmeninden anında yardım al; web'de ya da uygulamada kaldığın yerden devam et.
- Kurslar
- 30
- Dersler
- 120
Sıkça Sorulan Sorular
“Transformer'lar ve Dikkat Mekanizması: Sade Bir Anlatım” dersi ücretsiz mi?
Evet — “Transformer'lar ve Dikkat Mekanizması: Sade Bir Anlatım” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Engineering Academy kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Engineering Academy kursu toplamda 4 dersten oluşur.
“Transformer'lar ve Dikkat Mekanizması: Sade Bir Anlatım” dersinde ne öğreneceğim?
Dikkat mekanizmalarının, matematiği anlamaya gerek kalmadan modellerin ilgili bağlama odaklanmasını nasıl sağladığını inceleyerek transformer mimarisinin gizemini çözün. AI Engineering Academy ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.
AI Engineering Academy öğrenmeye başlamak için deneyim gerekli mi?
Önceden deneyim gerekmez. CoddyKit'te AI Engineering Academy, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 2. dersidir.
“Transformer'lar ve Dikkat Mekanizması: Sade Bir Anlatım” dersi ne kadar sürer?
Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.
Bu AI Engineering Academy dersinde kod yazıp çalıştırabilir miyim?
Evet. Her AI Engineering Academy dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.
Bu kursun tüm dersleri
- Otomatik Tamamlamadan ChatGPT'ye
- Transformer'lar ve Dikkat Mekanizması: Sade Bir Anlatım
- LLM'ler Nasıl Eğitilir
- LLM'lerin Yetenekleri ve Sınırlamaları