Mengevaluasi Model yang Disetel vs Basis
Bandingkan dengan model basis menggunakan set evaluasi Anda — terkadang penyetelan halus lebih banyak merugikan daripada membantu.
Mengevaluasi Model yang Disetel vs Basis adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.
Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.
Jangan Memercayai Kerugian Pelatihan
Kerugian pelatihan yang rendah tidak berarti kinerja yang lebih baik dalam produksi. Model mungkin mengalami overfitting, kehilangan kemampuan umum, atau memburuk pada tugas yang belum pernah dilihat.
Selalu evaluasi model yang disetel pada set evaluasi yang disisihkan.
Tiga Pemisahan Evaluasi yang Wajib Ada
- Pelatihan—digunakan dalam penyetelan halus
- Validasi—digunakan untuk memilih titik pemeriksaan terbaik
- Pengujian—tidak pernah dilihat selama pelatihan; digunakan ONLY untuk evaluasi akhir
A/B Against Base
results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')Waspadai Pelupaan Katastrofis
Penyetelan halus pada data yang sempit dapat membuat model memburuk pada tugas OTHER. Uji juga pada set evaluasi yang luas—bukan hanya spesialisasi baru Anda.
Pelaporan per Kategori
Beri tag pada set evaluasi Anda; laporkan skor untuk setiap kategori:
Category 'extraction': base 0.78 -> tuned 0.91 (+0.13)
Category 'reasoning': base 0.85 -> tuned 0.78 (-0.07) <-- regression
Category 'chat': base 0.82 -> tuned 0.83 (+0.01)Kalibrasi
Model yang disetel sering menjadi terlalu percaya diri. Bandingkan probabilitas kebenaran yang diprediksi dengan probabilitas aktual—lakukan kalibrasi bila diperlukan.
Penyimpangan Panjang dan Gaya
Model yang disetel cenderung mengikuti distribusi pelatihan. Jika data pelatihan lebih pendek, keluaran akan menjadi lebih pendek. Terkadang hal ini diinginkan; terkadang tidak.
Pengujian A/B di Dunia Nyata
Selain evaluasi luring, lakukan pengujian A/B dalam produksi:
if user.bucket == 'tuned':
response = tuned_model.run(...)
else:
response = base_model.run(...)
log_metric('thumbs_up', response.feedback)Membandingkan Kualitas dan Biaya
Model yang disetel mungkin lebih kecil dan lebih murah. Perbandingan total biaya-kualitas:
- GPT-4o dasar: $X per pemanggilan, kualitas Y
- Llama 8B yang disetel (dihosting sendiri): $X/10 per pemanggilan, kualitas 0.9Y
- Kemungkinan menjadi pemenang jika Y tetap cukup tinggi
Mode Kegagalan Tersembunyi
Cobalah masukan adversarial:
- Perintah yang mencoba melewati batas pengaman
- Masukan di luar distribusi
- Perintah kasus khusus
Terkadang penyetelan halus melemahkan keamanan; verifikasi sebelum merilisnya.
Catatan tentang LLM sebagai Penilai
Jika Anda menggunakan penilai LLM, gunakan keluarga model yang DIFFERENT dari model yang disetel. Jika tidak, penilai akan memberikan skor tinggi yang bias.
Kapan Mengulang Kumpulan Data
Jika evaluasi menunjukkan regresi pada kategori tertentu:
- Temukan contoh serupa dalam rekam jejak produksi
- Tambahkan contoh tersebut ke set pelatihan
- Lakukan pelatihan ulang
- Lakukan evaluasi ulang
Mengembalikan Versi Itu Tidak Masalah
Jika hasil penyetelan berkinerja buruk, buang dan coba lagi. Biaya hangus bukan alasan untuk merilis model yang lebih buruk.
Pelupaan Katastrofis
Apa yang dimaksud dengan pelupaan katastrofis dalam penyetelan halus?
Ringkasan
Evaluasi model yang disetel terhadap model dasar pada set acuan milik YOUR. Waspadai regresi per kategori. Lakukan A/B dalam produksi. Kembalikan versi sebelumnya jika kinerjanya menurun; ulangi kumpulan data jika hasilnya hanya menang sebagian.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Mengevaluasi Model yang Disetel vs Basis” gratis?
Ya — teks lengkap “Mengevaluasi Model yang Disetel vs Basis” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Mengevaluasi Model yang Disetel vs Basis”?
Bandingkan dengan model basis menggunakan set evaluasi Anda — terkadang penyetelan halus lebih banyak merugikan daripada membantu. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Agents?
Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.
Berapa lama pelajaran “Mengevaluasi Model yang Disetel vs Basis” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?
Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Saat Penyetelan Halus Lebih Unggul daripada Pemberian Perintah
- Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak
- LoRA dan QLoRA untuk Penyetelan Hemat Biaya
- Mengevaluasi Model yang Disetel vs Basis