0Pricing
AI Engineering Academy · Pelajaran

Transformer dan Attention dalam Bahasa Sederhana

Pahami arsitektur transformer dengan menjelajahi cara mekanisme attention memungkinkan model berfokus pada konteks yang relevan tanpa harus memahami matematikanya.

Transformer dan Attention dalam Bahasa Sederhana adalah pelajaran AI Engineering Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Engineering Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Engineering Academy mencakup 4 pelajaran total.

Masalah Utama: Ketergantungan Jangka Panjang

Dalam kalimat "piala itu tidak muat di dalam tas karena itu terlalu besar", apa yang dimaksud dengan "itu"? Model lama kehilangan jejak makna dalam kalimat yang panjang. Inilah masalah ketergantungan jangka panjang.

Perhatian sebagai Fokus Berbobot

Perhatian adalah cara model menentukan kata mana yang paling penting untuk setiap kata—seperti menyoroti bagian-bagian penting dari suatu bacaan, bukan memperlakukan semua kata secara sama.

Kueri, Kunci, dan Nilai

Perhatian bekerja seperti pencarian: setiap kata mengirimkan Query, mencocokkannya dengan setiap Key, lalu mengambil Values yang paling relevan. Kode di bawah ini menunjukkan gagasan intinya.

# Simplified self-attention in pseudocode
import numpy as np

def scaled_dot_product_attention(Q, K, V):
    d_k = Q.shape[-1]  # dimension of keys
    scores = Q @ K.T / np.sqrt(d_k)  # scale to prevent vanishing gradients
    weights = np.exp(scores) / np.sum(np.exp(scores), axis=-1, keepdims=True)  # softmax
    output = weights @ V  # weighted sum of values
    return output

Perhatian Multi-Kepala: Beragam Perspektif

Satu kepala perhatian menangkap satu jenis hubungan. Perhatian multi-kepala menjalankan banyak kepala secara paralel, sehingga model melihat kata-kata melalui beberapa sudut pandang sekaligus.

Pengodean Posisi: Menambahkan Urutan Kata

Perhatian saja mengabaikan urutan kata—"anjing menggigit manusia" terlihat sama seperti "manusia menggigit anjing". Pengodean posisi menambahkan informasi posisi agar urutan tidak hilang.

Lapisan Umpan Maju Setelah Perhatian

Setelah perhatian membagikan konteks, jaringan umpan maju memproses setiap kata secara terpisah. Menariknya, sebagian besar pengetahuan faktual model tampaknya tersimpan di sini.

Model Hanya-Penyandi vs Hanya-Pengurai

Model hanya-penyandi bergaya BERT membaca semua teks sekaligus untuk memahaminya. Model hanya-pengurai bergaya GPT membaca dari kiri ke kanan untuk menghasilkan teks—itulah yang dilakukan ChatGPT.

Penumpukan Lapisan dan Kedalaman

LLM modern menumpuk lusinan blok Transformer. Setiap lapisan menyempurnakan lapisan sebelumnya—lapisan awal menangkap tata bahasa, sedangkan lapisan yang lebih dalam menangani penalaran. Semakin dalam, semakin banyak proses berpikirnya.

Koneksi Residual dan Normalisasi Lapisan

Menumpuk banyak lapisan tidaklah mudah. Koneksi residual dan normalisasi lapisan menjaga sinyal tetap stabil, sehingga model yang dalam dapat dilatih secara andal hingga lebih dari 100 lapisan.

Mengapa Perhatian Dapat Berkembang dengan Baik

Perhatian mudah dijalankan secara paralel, sehingga lebih banyak GPU berarti pelatihan yang lebih cepat. Dengan cara inilah para peneliti berlatih menggunakan data dalam jumlah sangat besar dan menemukan hukum penskalaan yang terkenal.

FlashAttention dan Optimisasi Modern

Input yang panjang membuat perhatian standar sangat boros memori. FlashAttention menghitung hasil yang sama dengan jauh lebih efisien, sehingga jendela konteks besar menjadi praktis.

Pemeriksaan Singkat

Uji pemahaman Anda tentang konsep Rekayasa AI dari pelajaran ini.

Ringkasan Pelajaran

Ringkasan: perhatian-diri menghubungkan setiap kata dengan semua kata lainnya, perhatian multi-kepala menangkap banyak hubungan sekaligus, dan koneksi residual serta normalisasi memungkinkan model menjadi dalam. Selanjutnya: cara LLM dilatih.

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Transformer dan Attention dalam Bahasa Sederhana” gratis?

Ya — teks lengkap “Transformer dan Attention dalam Bahasa Sederhana” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Engineering Academy, upgrade ke CoddyKit PRO. Kursus AI Engineering Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Transformer dan Attention dalam Bahasa Sederhana”?

Pahami arsitektur transformer dengan menjelajahi cara mekanisme attention memungkinkan model berfokus pada konteks yang relevan tanpa harus memahami matematikanya. Kamu berlatih AI Engineering Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Engineering Academy?

Tidak diperlukan pengalaman sebelumnya. AI Engineering Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.

Berapa lama pelajaran “Transformer dan Attention dalam Bahasa Sederhana” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Engineering Academy ini?

Ya. Setiap pelajaran AI Engineering Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Dari Pelengkapan Otomatis hingga ChatGPT
  2. Transformer dan Attention dalam Bahasa Sederhana
  3. Cara LLM Dilatih
  4. Kemampuan dan Keterbatasan LLM
← Kembali ke AI Engineering Academy