Cara LLM Dilatih
Pelajari tahapan pelatihan LLM: prapelatihan pada korpus berukuran sangat besar, penyempurnaan terbimbing, dan RLHF, serta alasan setiap tahap penting bagi perilaku model.
Cara LLM Dilatih adalah pelajaran AI Engineering Academy gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Engineering Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Engineering Academy mencakup 4 pelajaran total.
Tiga Tahap Pelatihan LLM
LLM dibangun melalui tiga tahap: prapelatihan mengajarkan bahasa dan pengetahuan, penyetelan halus mengajarkan kepatuhan terhadap instruksi, dan RLHF menyelaraskan model dengan keinginan manusia.
Prapelatihan: Prediksi Token Berikutnya dalam Skala Besar
Prapelatihan memberikan banyak sekali teks kepada model dengan satu tugas: memprediksi token berikutnya. Tujuan sederhana ini sudah cukup untuk mengajarkan tata bahasa, fakta, dan penalaran secara bertahap.
Kualitas dan Kurasi Data Pelatihan
Teks mentah dari internet berantakan. Tim membersihkannya dengan alur data yang menyaring, menghapus duplikasi, dan menilai kualitas. Aturan praktisnya: data yang lebih baik mengalahkan model yang lebih besar.
Fungsi Kerugian dan Optimisasi
Pelatihan meminimalkan kerugian entropi silang—seberapa jauh tebakan model dari token berikutnya yang benar. Bobot digeser sedikit, lalu proses ini diulang miliaran kali. Kode tersebut menunjukkan matematikanya.
# Illustrative cross-entropy loss for a single token prediction
import math
vocab_size = 50000
correct_token_index = 4217 # index for the word 'Paris'
# Model output probabilities (softmax of logits)
model_probs = [0.00002] * vocab_size # simplified uniform base
model_probs[correct_token_index] = 0.70 # model is 70% confident in 'Paris'
loss = -math.log(model_probs[correct_token_index])
print(f'Cross-entropy loss: {loss:.4f}') # ~0.3567Kemampuan Emergen dari Skala
Pada skala yang cukup besar, muncul kemampuan emergen baru—seperti penalaran langkah demi langkah—yang tidak dimiliki model kecil. Tidak ada yang melatihnya secara langsung; skala yang memunculkannya.
Penyetelan Halus Terawasi pada Pasangan Instruksi
Model mentah hanya melanjutkan teks. Penyetelan halus terawasi melatihnya dengan pasangan (instruksi, jawaban ideal), sehingga model belajar benar-benar menjawab, bukan terus berbicara bertele-tele.
# Illustrative SFT data format
training_example = {
'messages': [
{'role': 'system', 'content': 'You are a helpful assistant.'},
{'role': 'user', 'content': 'What is the capital of France?'},
{'role': 'assistant', 'content': 'The capital of France is Paris.'}
]
}
# During SFT, loss is computed only on the assistant turn tokens
# The system and user tokens are provided as context but not trained onTahap 1 RLHF: Melatih Model Imbalan
RLHF dimulai dengan model imbalan. Manusia memilih jawaban yang lebih baik dari dua jawaban, lalu model imbalan belajar memprediksi preferensi tersebut—sebagai pengganti selera manusia.
Tahap 2 RLHF: Penyetelan Halus PPO
Berikutnya, PPO menyetel LLM agar memperoleh skor lebih tinggi dari model imbalan. Penalti KL mencegah model menyimpang secara aneh dan mengeksploitasi imbalan alih-alih benar-benar membantu.
Optimisasi Preferensi Langsung: RLHF yang Lebih Sederhana
PPO rumit. DPO adalah alternatif yang lebih sederhana: metode ini melatih model langsung dari pasangan jawaban yang disukai dan ditolak—tanpa memerlukan model imbalan terpisah.
Hukum Penskalaan Chinchilla: Pelatihan Optimal Komputasi
Temuan Chinchilla: model-model lama kurang dilatih. Untuk anggaran tertentu, tingkatkan skala data dan ukuran model secara bersamaan—kira-kira 20 token per parameter untuk hasil terbaik.
Dampak Setiap Tahap Pelatihan
Setiap tahap mengendalikan hal tertentu: prapelatihan menentukan apa yang diketahui model, penyetelan halus menentukan perilakunya, dan RLHF menentukan nilainya. Dengan demikian, Anda tahu bagian mana yang perlu diperbaiki.
Pemeriksaan Singkat
Uji pemahaman Anda tentang konsep Rekayasa AI dari pelajaran ini.
Ringkasan Pelajaran
Ringkasan: prapelatihan membangun pengetahuan, penyetelan halus membangun kepatuhan terhadap instruksi, dan RLHF atau DPO menyelaraskan model dengan nilai-nilai manusia. Selanjutnya: hal-hal yang dapat dan tidak dapat dilakukan LLM. 💡
Belajar Python dengan tutor AI — gratis
Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.
- Kursus
- 30
- Pelajaran
- 120
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Cara LLM Dilatih” gratis?
Ya — teks lengkap “Cara LLM Dilatih” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Engineering Academy, upgrade ke CoddyKit PRO. Kursus AI Engineering Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Cara LLM Dilatih”?
Pelajari tahapan pelatihan LLM: prapelatihan pada korpus berukuran sangat besar, penyempurnaan terbimbing, dan RLHF, serta alasan setiap tahap penting bagi perilaku model. Kamu berlatih AI Engineering Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Engineering Academy?
Tidak diperlukan pengalaman sebelumnya. AI Engineering Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.
Berapa lama pelajaran “Cara LLM Dilatih” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Engineering Academy ini?
Ya. Setiap pelajaran AI Engineering Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Dari Pelengkapan Otomatis hingga ChatGPT
- Transformer dan Attention dalam Bahasa Sederhana
- Cara LLM Dilatih
- Kemampuan dan Keterbatasan LLM