AI Agents · Pelajaran

Kendala LLM sebagai Juri

Juri cenderung bias terhadap jawaban yang panjang, kesulitan menilai keluarannya sendiri, dan memerlukan kalibrasi yang cermat.

Pelajaran 3 dari 415 langkah

Kendala LLM sebagai Juri adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.

Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.

Mengapa Menggunakan Penilai LLM?

Untuk keluaran terbuka (esai, tinjauan kode, jawaban percakapan), tidak ada satu jawaban yang benar. Mempekerjakan manusia untuk menilai ribuan keluaran itu mahal.

LLM sebagai Penilai — menggunakan model yang kuat untuk memberi skor pada keluaran — mengisi kekosongan tersebut.

Basic LLM Judge

judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.

Question: {question}
Answer: {answer}
'''

Jebakan 1: Bias Posisi

Penilai cenderung memilih jawaban FIRST dalam perbandingan berpasangan. Selalu acak urutannya dan jalankan dua kali:

def fair_compare(a, b):
    score_ab = compare(a, b)
    score_ba = compare(b, a)   # swapped
    return (score_ab + score_ba) / 2

Jebakan 2: Bias Panjang

Penilai cenderung memilih jawaban LONGER, meskipun jawaban yang lebih pendek lebih baik. Kalibrasikan dengan menormalkan panjang atau memberi instruksi kepada penilai:

judge_prompt = '... Penalize answers that are verbose without adding value ...'

Jebakan 3: Preferensi terhadap Diri Sendiri

Model cenderung memilih keluarannya sendiri. Jika GPT-4 menilai pekerjaannya sendiri, model tersebut memberi skor yang lebih tinggi daripada yang seharusnya. Gunakan keluarga model yang berbeda untuk penilaian:

  • Keluaran GPT-4 -> dinilai oleh Claude
  • Keluaran Claude -> dinilai oleh GPT-4

Jebakan 4: Kecenderungan Menjilat

Penilai menyetujui opini kuat dalam jawaban. "Saya 100% yakin..." mendapat skor lebih tinggi daripada "Menurut saya...". Hapus kata-kata yang menyatakan keyakinan sebelum melakukan penilaian.

Jebakan 5: Inflasi Skor

Pada skala 1-5, penilai cenderung berkumpul di sekitar angka 4. Gunakan penilaian biner (benar/salah) untuk mendapatkan sinyal yang lebih tajam:

judge_prompt = '... Return PASS or FAIL only ...'

Jebakan 6: Bias Format

Jawaban berbentuk daftar berpoin mendapat skor lebih tinggi daripada prosa, terlepas dari kebenarannya. Waspadalah; terkadang wajibkan format untuk menghilangkan variabel tersebut.

Kalibrasikan terhadap Manusia

Ukur seberapa baik penilai berkorelasi dengan penilaian manusia pada suatu sampel:

from scipy.stats import pearsonr

human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this task

Gunakan Perbandingan Berpasangan jika Memungkinkan

"Apakah A lebih baik daripada B?" lebih andal daripada "Beri skor A dari 1-5". Saat memilih di antara dua perintah, perbandingan berpasangan > perbandingan absolut.

Penilaian dengan Rantai Pemikiran

Buat penilai bernalar terlebih dahulu:

judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.

Question: {q}
Reference: {r}
Answer: {a}
'''

Biaya

Penilaian dengan GPT-4 menggandakan biaya evaluasi. Untuk pemeriksaan rutin, gunakan penilai yang lebih murah (gpt-4o-mini atau claude-haiku) dan simpan penilai besar untuk rilis.

Gabungkan dengan Aturan

Jangan hanya mengandalkan penilai. Gabungkan:

  • Aturan ("mengandung '30 hari'")
  • Heuristik (rentang panjang)
  • Penilai LLM untuk bagian yang terbuka

Mengalibrasi Penilai LLM

Bagaimana Anda memeriksa apakah penilai LLM Anda dapat diandalkan?

Ringkasan

Penilai LLM berguna tetapi memiliki bias. Acak posisi, normalkan panjang, gunakan keluarga model yang berbeda, kalibrasikan terhadap manusia, dan gabungkan dengan aturan tegas.

Gratis untuk memulai

Belajar AI Agents dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
60
Pelajaran
239

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Kendala LLM sebagai Juri” gratis?

Ya — teks lengkap “Kendala LLM sebagai Juri” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Kendala LLM sebagai Juri”?

Juri cenderung bias terhadap jawaban yang panjang, kesulitan menilai keluarannya sendiri, dan memerlukan kalibrasi yang cermat. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Agents?

Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.

Berapa lama pelajaran “Kendala LLM sebagai Juri” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?

Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Pengembangan Agen Berbasis Evaluasi
  2. Membangun Kumpulan Uji Emas
  3. Kendala LLM sebagai Juri
  4. Rangkaian Tolok Ukur: SWE-Bench, GAIA, ToolBench
← Kembali ke AI Agents