Attention Multi-Head dan Posisi
Berbagai sudut pandang ditambah pemahaman urutan
Attention Multi-Head dan Posisi adalah pelajaran NLP Academy gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar NLP Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus NLP Academy mencakup 4 pelajaran total.
Satu Kepala Itu Terbatas
Satu kepala atensi hanya dapat melacak satu jenis hubungan pada satu waktu. Bahasa nyata memerlukan banyak pola yang diperhatikan secara bersamaan. 🧠
Banyak Kepala, Banyak Sudut Pandang
Atensi multi-kepala menjalankan beberapa perhitungan atensi secara paralel, masing-masing dengan proyeksi hasil pembelajaran dan fokusnya sendiri.
Hal yang Dipelajari Setiap Kepala
Satu kepala mungkin melacak hubungan subjek-verba, sementara kepala lain mengikuti kata ganti. Bersama-sama, keduanya menangkap gambaran kalimat yang jauh lebih kaya.
Membagi Dimensi
Model membagi ukuran vektornya ke seluruh kepala, sehingga setiap kepala bekerja dalam subruang yang lebih kecil. Total komputasinya tetap kurang lebih sama.
d_head = d_model // num_headsMenggabungkan Kepala
Setelah setiap kepala menghasilkan output, Anda menggabungkan semuanya dan meneruskan hasilnya melalui satu lapisan linear lagi untuk memadukan berbagai sudut pandang.
out = concat(head_1, head_2, ...) @ W_oAtensi Mengabaikan Urutan
Atensi-diri memperlakukan input sebagai himpunan, sehingga dengan sendirinya tidak dapat membedakan "dog bites man" dari "man bites dog." Atensi-diri buta terhadap urutan.
Menambahkan Informasi Posisi
Untuk mengatasinya, kita menyisipkan pengodean posisi ke setiap kata agar model mengetahui letak setiap token dalam urutan.
Pengodean Sinusoidal
Transformer asli menggunakan gelombang sinus dan kosinus tetap dengan frekuensi berbeda untuk memberi setiap posisi ciri khas yang unik dan halus.
pe[pos, 2i] = sin(pos / 10000 ** (2*i/d))Ditambahkan, Bukan Ditempelkan
Vektor posisi ditambahkan ke penyematan kata, bukan ditempelkan di bagian akhir. Jadi, setiap token membawa makna dan posisi secara bersamaan.
x = token_embeddings + positional_encodingPosisi yang Dipelajari Juga
Banyak model modern mengganti gelombang tetap dengan penyematan posisi yang dipelajari, dilatih bersama semua komponen lain agar lebih fleksibel.
Mengapa Keduanya Penting
Atensi multi-kepala melihat banyak hubungan, sedangkan pengodean posisi memulihkan urutan. Bersama-sama, keduanya memungkinkan Transformer benar-benar memahami urutan. ✨
Pemeriksaan Singkat
Mari kita menguji posisi dan kepala.
Rangkuman
Anda telah melihat bagaimana atensi multi-kepala menangkap banyak hubungan secara paralel, sementara pengodean posisi memberi model pemahaman tentang urutan. 🎯
Belajar Python dengan tutor AI — gratis
Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.
- Kursus
- 30
- Pelajaran
- 120
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Attention Multi-Head dan Posisi” gratis?
Ya — teks lengkap “Attention Multi-Head dan Posisi” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus NLP Academy, upgrade ke CoddyKit PRO. Kursus NLP Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Attention Multi-Head dan Posisi”?
Berbagai sudut pandang ditambah pemahaman urutan Kamu berlatih NLP Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai NLP Academy?
Tidak diperlukan pengalaman sebelumnya. NLP Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.
Berapa lama pelajaran “Attention Multi-Head dan Posisi” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran NLP Academy ini?
Ya. Setiap pelajaran NLP Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Gagasan tentang Attention
- Self-Attention, Langkah demi Langkah
- Attention Multi-Head dan Posisi
- Bagian Dalam Blok Transformer