0Pricing
AI Agents · Ders

LLM'yi Hakem Olarak Kullanmanın Tuzakları

Hakemler ayrıntılı yanıtları kayırır, kendi çıktılarıyla zorlanır ve dikkatli kalibrasyon gerektirir.

LLM'yi Hakem Olarak Kullanmanın Tuzakları, CoddyKit'te ücretsiz bir AI Agents dersidir. Bu, 4 dersinin 3. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Agents öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Agents kursu toplamda 4 dersten oluşur.

Bu dersin bazı bölümleri henüz çevrilmemiş olup İngilizce olarak gösterilmektedir.

LLM Değerlendiricileri Neden Kullanılır

Açık uçlu çıktılar (denemeler, kod incelemeleri, sohbet yanıtları) için tek bir doğru yanıt yoktur. Binlerce çıktıyı puanlamaları için insanları işe almak pahalıdır.

Değerlendirici Olarak LLM — çıktıları puanlamak için güçlü bir model kullanmak — bu boşluğu doldurur.

Basic LLM Judge

judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.

Question: {question}
Answer: {answer}
'''

1. Tuzak: Konum Yanlılığı

Değerlendiriciler ikili karşılaştırmada FIRST yanıtı tercih eder. Sıralamayı her zaman rastgeleleştirin ve iki kez çalıştırın:

def fair_compare(a, b):
    score_ab = compare(a, b)
    score_ba = compare(b, a)   # swapped
    return (score_ab + score_ba) / 2

2. Tuzak: Uzunluk Yanlılığı

Değerlendiriciler, daha kısa yanıtlar daha iyi olsa bile LONGER yanıtları tercih eder. Yanıtları uzunluk açısından normalleştirerek veya değerlendiriciye talimat vererek kalibrasyon yapın:

judge_prompt = '... Penalize answers that are verbose without adding value ...'

3. Tuzak: Kendini Tercih Etme

Modeller kendi çıktılarını tercih eder. GPT-4 kendi çalışmasını değerlendirirse kendisine olması gerekenden daha yüksek puan verir. Değerlendirme için farklı bir model ailesi kullanın:

  • GPT-4 çıktıları -> Claude tarafından değerlendirilir
  • Claude çıktıları -> GPT-4 tarafından değerlendirilir

4. Tuzak: Yaranmacılık

Değerlendiriciler, yanıttaki güçlü görüşlere katılır. "%100 eminim..." ifadesi, "Bence..." ifadesinden daha yüksek puan alır. Değerlendirmeden önce güven bildiren sözcükleri çıkarın.

5. Tuzak: Puan Şişmesi

1-5 ölçeklerinde değerlendiriciler 4 civarında kümelenir. Daha keskin bir sinyal için ikili puanlama (doğru/yanlış) kullanın:

judge_prompt = '... Return PASS or FAIL only ...'

6. Tuzak: Biçim Yanlılığı

Madde işaretli yanıtlar, doğruluklarından bağımsız olarak düzyazıdan daha yüksek puan alır. Bunun farkında olun; bazen değişkeni ortadan kaldırmak için biçimi zorunlu tutun.

İnsanlara Göre Kalibre Edin

Bir örneklemde değerlendiricinin insan puanlarıyla ne kadar uyumlu olduğunu ölçün:

from scipy.stats import pearsonr

human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this task

Mümkünse İkili Karşılaştırma Kullanın

"A, B'den daha iyi mi?" sorusu, "A'yı 1-5 arasında puanlayın" sorusundan daha güvenilirdir. İki istem arasında seçim yaparken ikili karşılaştırma > mutlak puanlama.

Düşünce Zinciriyle Değerlendirme

Değerlendiricinin önce akıl yürütmesini sağlayın:

judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.

Question: {q}
Reference: {r}
Answer: {a}
'''

Maliyet

GPT-4 ile değerlendirme yapmak maliyeti iki katına çıkarır. Rutin kontrollerde daha ucuz değerlendiriciler (gpt-4o-mini veya claude-haiku) kullanın ve pahalı değerlendiricileri sürümler için saklayın.

Kurallarla Birleştirin

Yalnızca değerlendiriciye güvenmeyin. Şunları birleştirin:

  • Kurallar ("'30 gün' içeriyor")
  • Sezgisel ölçütler (uzunluk aralığı)
  • Açık uçlu bölüm için LLM değerlendiricisi

Bir LLM Değerlendiricisini Kalibre Etme

LLM değerlendiricinizin güvenilir olup olmadığını nasıl kontrol edersiniz?

Özet

LLM değerlendiricileri kullanışlıdır ancak yanlıdır. Konumları rastgeleleştirin, uzunluğu normalleştirin, farklı model aileleri kullanın, insanlara göre kalibre edin ve kesin kurallarla birleştirin.

Sıkça Sorulan Sorular

“LLM'yi Hakem Olarak Kullanmanın Tuzakları” dersi ücretsiz mi?

Evet — “LLM'yi Hakem Olarak Kullanmanın Tuzakları” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Agents kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Agents kursu toplamda 4 dersten oluşur.

“LLM'yi Hakem Olarak Kullanmanın Tuzakları” dersinde ne öğreneceğim?

Hakemler ayrıntılı yanıtları kayırır, kendi çıktılarıyla zorlanır ve dikkatli kalibrasyon gerektirir. AI Agents ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.

AI Agents öğrenmeye başlamak için deneyim gerekli mi?

Önceden deneyim gerekmez. CoddyKit'te AI Agents, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 3. dersidir.

“LLM'yi Hakem Olarak Kullanmanın Tuzakları” dersi ne kadar sürer?

Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.

Bu AI Agents dersinde kod yazıp çalıştırabilir miyim?

Evet. Her AI Agents dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.

Bu kursun tüm dersleri

  1. Aracılar için Değerlendirme Odaklı Geliştirme
  2. Altın Sınama Kümesi Oluşturma
  3. LLM'yi Hakem Olarak Kullanmanın Tuzakları
  4. Kıyaslama Kümeleri: SWE-Bench, GAIA, ToolBench
← AI Agents Sayfasına Dön