AI Engineering Academy · Pelajaran

Transformer dan Perhatian dalam Bahasa Mudah

Fahami seni bina transformer dengan meneroka cara mekanisme perhatian membolehkan model menumpukan pada konteks yang berkaitan tanpa perlu memahami matematiknya.

Pelajaran 2 daripada 413 langkah

Transformer dan Perhatian dalam Bahasa Mudah ialah pelajaran AI Engineering Academy percuma di CoddyKit. Ini ialah pelajaran 2 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran AI Engineering Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus AI Engineering Academy merangkumi sejumlah 4 pelajaran.

Masalah Teras: Kebergantungan Jarak Jauh

Dalam ayat "trofi itu tidak muat di dalam beg kerana ia terlalu besar", apakah yang dimaksudkan dengan "ia"? Model lama hilang jejak apabila berhadapan dengan ayat yang panjang. Inilah masalah kebergantungan jarak jauh.

Perhatian sebagai Fokus Berpemberat

Perhatian ialah cara model menentukan perkataan yang paling penting untuk setiap perkataan — seperti menyerlahkan bahagian utama dalam petikan dan bukannya menganggap semua perkataan sama penting.

Pertanyaan, Kunci dan Nilai

Perhatian berfungsi seperti carian: setiap perkataan menghantar Pertanyaan, memadankannya dengan setiap Kunci, lalu mengambil Nilai yang paling berkaitan. Kod di bawah menunjukkan idea terasnya.

# Simplified self-attention in pseudocode
import numpy as np

def scaled_dot_product_attention(Q, K, V):
    d_k = Q.shape[-1]  # dimension of keys
    scores = Q @ K.T / np.sqrt(d_k)  # scale to prevent vanishing gradients
    weights = np.exp(scores) / np.sum(np.exp(scores), axis=-1, keepdims=True)  # softmax
    output = weights @ V  # weighted sum of values
    return output

Perhatian Berbilang Kepala: Pelbagai Perspektif

Satu kepala perhatian mengesan satu jenis hubungan. Perhatian berbilang kepala menjalankan banyak kepala secara selari, supaya model dapat melihat perkataan melalui beberapa sudut pada masa yang sama.

Pengekodan Kedudukan: Menambah Susunan Perkataan

Perhatian sahaja tidak mengambil kira susunan perkataan — "anjing menggigit lelaki" kelihatan sama seperti "lelaki menggigit anjing." Pengekodan kedudukan menambahkan maklumat kedudukan supaya susunan tidak hilang.

Lapisan Suapan Hadapan selepas Perhatian

Selepas perhatian berkongsi konteks, rangkaian suapan hadapan memproses setiap perkataan secara berasingan. Menariknya, sebahagian besar pengetahuan fakta model nampaknya tersimpan di sini.

Model Pengekod Sahaja berbanding Penyahkod Sahaja

Model pengekod sahaja gaya BERT membaca semua teks serentak untuk memahaminya. Model penyahkod sahaja gaya GPT membaca dari kiri ke kanan untuk menjana teks — seperti yang dilakukan oleh ChatGPT.

Susunan Lapisan dan Kedalaman

LLM moden menyusun berpuluh-puluh blok Transformer. Setiap lapisan memperhalus lapisan sebelumnya — lapisan awal mengesan tatabahasa, manakala lapisan yang lebih dalam mengendalikan penaakulan. Lebih dalam, lebih banyak pemikiran.

Sambungan Baki dan Penormalan Lapisan

Menyusun banyak lapisan bukanlah mudah. Sambungan baki dan penormalan lapisan memastikan isyarat kekal stabil, supaya model dalam dapat dilatih dengan baik sehingga melebihi 100 lapisan.

Mengapa Perhatian Berskala dengan Begitu Baik

Perhatian mudah dijalankan secara selari, jadi lebih banyak GPU bermakna latihan yang lebih pantas. Dengan cara inilah penyelidik melatih model menggunakan data yang sangat besar dan menemui hukum penskalaan yang terkenal.

FlashAttention dan Pengoptimuman Moden

Input yang panjang menjadikan perhatian standard sangat memerlukan memori. FlashAttention mengira hasil yang sama dengan jauh lebih cekap, lalu menjadikan tetingkap konteks besar sesuatu yang praktikal.

Semakan Pantas

Uji pemahaman anda tentang konsep Kejuruteraan AI daripada pelajaran ini.

Ulang Kaji Pelajaran

Ulang kaji: perhatian kendiri menghubungkan setiap perkataan dengan semua perkataan lain, perhatian berbilang kepala menangkap banyak hubungan serentak, dan sambungan baki serta penormalan membolehkan model menjadi lebih dalam. Seterusnya: cara LLM dilatih.

Percuma untuk bermula

Pelajari Python dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
30
Pelajaran
120

Soalan Lazim

Adakah pelajaran “Transformer dan Perhatian dalam Bahasa Mudah” percuma?

Ya — teks penuh “Transformer dan Perhatian dalam Bahasa Mudah” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus AI Engineering Academy, tingkat taraf kepada CoddyKit PRO. Kursus AI Engineering Academy merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Transformer dan Perhatian dalam Bahasa Mudah”?

Fahami seni bina transformer dengan meneroka cara mekanisme perhatian membolehkan model menumpukan pada konteks yang berkaitan tanpa perlu memahami matematiknya. Anda berlatih AI Engineering Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan AI Engineering Academy?

Tiada pengalaman terdahulu diperlukan. Pembelajaran AI Engineering Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 2 daripada 4.

Berapa lamakah pelajaran “Transformer dan Perhatian dalam Bahasa Mudah” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran AI Engineering Academy ini?

Ya. Setiap pelajaran AI Engineering Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Daripada Autolengkap kepada ChatGPT
  2. Transformer dan Perhatian dalam Bahasa Mudah
  3. Cara LLM Dilatih
  4. Keupayaan dan Batasan LLM
← Kembali ke AI Engineering Academy