NLP Academy · Pelajaran

Attention Multi-Head dan Posisi

Berbagai sudut pandang ditambah pemahaman urutan

Pelajaran 3 dari 413 langkah

Attention Multi-Head dan Posisi adalah pelajaran NLP Academy gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar NLP Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus NLP Academy mencakup 4 pelajaran total.

Satu Kepala Itu Terbatas

Satu kepala atensi hanya dapat melacak satu jenis hubungan pada satu waktu. Bahasa nyata memerlukan banyak pola yang diperhatikan secara bersamaan. 🧠

Banyak Kepala, Banyak Sudut Pandang

Atensi multi-kepala menjalankan beberapa perhitungan atensi secara paralel, masing-masing dengan proyeksi hasil pembelajaran dan fokusnya sendiri.

Hal yang Dipelajari Setiap Kepala

Satu kepala mungkin melacak hubungan subjek-verba, sementara kepala lain mengikuti kata ganti. Bersama-sama, keduanya menangkap gambaran kalimat yang jauh lebih kaya.

Membagi Dimensi

Model membagi ukuran vektornya ke seluruh kepala, sehingga setiap kepala bekerja dalam subruang yang lebih kecil. Total komputasinya tetap kurang lebih sama.

d_head = d_model // num_heads

Menggabungkan Kepala

Setelah setiap kepala menghasilkan output, Anda menggabungkan semuanya dan meneruskan hasilnya melalui satu lapisan linear lagi untuk memadukan berbagai sudut pandang.

out = concat(head_1, head_2, ...) @ W_o

Atensi Mengabaikan Urutan

Atensi-diri memperlakukan input sebagai himpunan, sehingga dengan sendirinya tidak dapat membedakan "dog bites man" dari "man bites dog." Atensi-diri buta terhadap urutan.

Menambahkan Informasi Posisi

Untuk mengatasinya, kita menyisipkan pengodean posisi ke setiap kata agar model mengetahui letak setiap token dalam urutan.

Pengodean Sinusoidal

Transformer asli menggunakan gelombang sinus dan kosinus tetap dengan frekuensi berbeda untuk memberi setiap posisi ciri khas yang unik dan halus.

pe[pos, 2i] = sin(pos / 10000 ** (2*i/d))

Ditambahkan, Bukan Ditempelkan

Vektor posisi ditambahkan ke penyematan kata, bukan ditempelkan di bagian akhir. Jadi, setiap token membawa makna dan posisi secara bersamaan.

x = token_embeddings + positional_encoding

Posisi yang Dipelajari Juga

Banyak model modern mengganti gelombang tetap dengan penyematan posisi yang dipelajari, dilatih bersama semua komponen lain agar lebih fleksibel.

Mengapa Keduanya Penting

Atensi multi-kepala melihat banyak hubungan, sedangkan pengodean posisi memulihkan urutan. Bersama-sama, keduanya memungkinkan Transformer benar-benar memahami urutan. ✨

Pemeriksaan Singkat

Mari kita menguji posisi dan kepala.

Rangkuman

Anda telah melihat bagaimana atensi multi-kepala menangkap banyak hubungan secara paralel, sementara pengodean posisi memberi model pemahaman tentang urutan. 🎯

Gratis untuk memulai

Belajar Python dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
30
Pelajaran
120

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Attention Multi-Head dan Posisi” gratis?

Ya — teks lengkap “Attention Multi-Head dan Posisi” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus NLP Academy, upgrade ke CoddyKit PRO. Kursus NLP Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Attention Multi-Head dan Posisi”?

Berbagai sudut pandang ditambah pemahaman urutan Kamu berlatih NLP Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai NLP Academy?

Tidak diperlukan pengalaman sebelumnya. NLP Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.

Berapa lama pelajaran “Attention Multi-Head dan Posisi” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran NLP Academy ini?

Ya. Setiap pelajaran NLP Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Gagasan tentang Attention
  2. Self-Attention, Langkah demi Langkah
  3. Attention Multi-Head dan Posisi
  4. Bagian Dalam Blok Transformer
← Kembali ke NLP Academy