0Pricing
AI Agents · Pelajaran

Mengevaluasi Model yang Disetel vs Basis

Bandingkan dengan model basis menggunakan set evaluasi Anda — terkadang penyetelan halus lebih banyak merugikan daripada membantu.

Mengevaluasi Model yang Disetel vs Basis adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.

Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.

Jangan Memercayai Kerugian Pelatihan

Kerugian pelatihan yang rendah tidak berarti kinerja yang lebih baik dalam produksi. Model mungkin mengalami overfitting, kehilangan kemampuan umum, atau memburuk pada tugas yang belum pernah dilihat.

Selalu evaluasi model yang disetel pada set evaluasi yang disisihkan.

Tiga Pemisahan Evaluasi yang Wajib Ada

  1. Pelatihan—digunakan dalam penyetelan halus
  2. Validasi—digunakan untuk memilih titik pemeriksaan terbaik
  3. Pengujian—tidak pernah dilihat selama pelatihan; digunakan ONLY untuk evaluasi akhir

A/B Against Base

results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')

Waspadai Pelupaan Katastrofis

Penyetelan halus pada data yang sempit dapat membuat model memburuk pada tugas OTHER. Uji juga pada set evaluasi yang luas—bukan hanya spesialisasi baru Anda.

Pelaporan per Kategori

Beri tag pada set evaluasi Anda; laporkan skor untuk setiap kategori:

Category 'extraction': base 0.78 -> tuned 0.91  (+0.13)
Category 'reasoning':  base 0.85 -> tuned 0.78  (-0.07)   <-- regression
Category 'chat':       base 0.82 -> tuned 0.83  (+0.01)

Kalibrasi

Model yang disetel sering menjadi terlalu percaya diri. Bandingkan probabilitas kebenaran yang diprediksi dengan probabilitas aktual—lakukan kalibrasi bila diperlukan.

Penyimpangan Panjang dan Gaya

Model yang disetel cenderung mengikuti distribusi pelatihan. Jika data pelatihan lebih pendek, keluaran akan menjadi lebih pendek. Terkadang hal ini diinginkan; terkadang tidak.

Pengujian A/B di Dunia Nyata

Selain evaluasi luring, lakukan pengujian A/B dalam produksi:

if user.bucket == 'tuned':
    response = tuned_model.run(...)
else:
    response = base_model.run(...)

log_metric('thumbs_up', response.feedback)

Membandingkan Kualitas dan Biaya

Model yang disetel mungkin lebih kecil dan lebih murah. Perbandingan total biaya-kualitas:

  • GPT-4o dasar: $X per pemanggilan, kualitas Y
  • Llama 8B yang disetel (dihosting sendiri): $X/10 per pemanggilan, kualitas 0.9Y
  • Kemungkinan menjadi pemenang jika Y tetap cukup tinggi

Mode Kegagalan Tersembunyi

Cobalah masukan adversarial:

  • Perintah yang mencoba melewati batas pengaman
  • Masukan di luar distribusi
  • Perintah kasus khusus

Terkadang penyetelan halus melemahkan keamanan; verifikasi sebelum merilisnya.

Catatan tentang LLM sebagai Penilai

Jika Anda menggunakan penilai LLM, gunakan keluarga model yang DIFFERENT dari model yang disetel. Jika tidak, penilai akan memberikan skor tinggi yang bias.

Kapan Mengulang Kumpulan Data

Jika evaluasi menunjukkan regresi pada kategori tertentu:

  1. Temukan contoh serupa dalam rekam jejak produksi
  2. Tambahkan contoh tersebut ke set pelatihan
  3. Lakukan pelatihan ulang
  4. Lakukan evaluasi ulang

Mengembalikan Versi Itu Tidak Masalah

Jika hasil penyetelan berkinerja buruk, buang dan coba lagi. Biaya hangus bukan alasan untuk merilis model yang lebih buruk.

Pelupaan Katastrofis

Apa yang dimaksud dengan pelupaan katastrofis dalam penyetelan halus?

Ringkasan

Evaluasi model yang disetel terhadap model dasar pada set acuan milik YOUR. Waspadai regresi per kategori. Lakukan A/B dalam produksi. Kembalikan versi sebelumnya jika kinerjanya menurun; ulangi kumpulan data jika hasilnya hanya menang sebagian.

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Mengevaluasi Model yang Disetel vs Basis” gratis?

Ya — teks lengkap “Mengevaluasi Model yang Disetel vs Basis” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Mengevaluasi Model yang Disetel vs Basis”?

Bandingkan dengan model basis menggunakan set evaluasi Anda — terkadang penyetelan halus lebih banyak merugikan daripada membantu. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Agents?

Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.

Berapa lama pelajaran “Mengevaluasi Model yang Disetel vs Basis” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?

Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Saat Penyetelan Halus Lebih Unggul daripada Pemberian Perintah
  2. Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak
  3. LoRA dan QLoRA untuk Penyetelan Hemat Biaya
  4. Mengevaluasi Model yang Disetel vs Basis
← Kembali ke AI Agents