0Pricing
AI Agents · Lektion

Fallstricke bei LLM-as-a-Judge

Judes bevorzugen voreingenommen ausführliche Antworten, haben Schwierigkeiten mit ihren eigenen Ausgaben und müssen sorgfältig kalibriert werden.

Fallstricke bei LLM-as-a-Judge ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.

Warum LLM-Judges?

Für offene Ausgaben (Aufsätze, Code-Reviews, dialogorientierte Antworten) gibt es keine einzelne richtige Antwort. Menschen zu beauftragen, Tausende von Ausgaben zu bewerten, ist teuer.

LLM-as-a-Judge — ein leistungsstarkes Modell zum Bewerten von Ausgaben zu verwenden — schließt diese Lücke.

Basic LLM Judge

judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.

Question: {question}
Answer: {answer}
'''

Fallstrick 1: Positionsverzerrung

Judges bevorzugen in einem paarweisen Vergleich die ERSTE Antwort. Vertauschen Sie die Reihenfolge immer zufällig und führen Sie den Vergleich zweimal aus:

def fair_compare(a, b):
    score_ab = compare(a, b)
    score_ba = compare(b, a)   # swapped
    return (score_ab + score_ba) / 2

Fallstrick 2: Längenverzerrung

Judges bevorzugen LÄNGERE Antworten, selbst wenn kürzere besser sind. Kalibrieren Sie durch Normalisieren oder weisen Sie den Judge entsprechend an:

judge_prompt = '... Penalize answers that are verbose without adding value ...'

Fallstrick 3: Selbstbevorzugung

Modelle bevorzugen ihre eigenen Ausgaben. Wenn GPT-4 seine eigene Arbeit bewertet, gibt es sich eine höhere Bewertung, als angemessen wäre. Verwenden Sie zum Bewerten eine andere Modellfamilie:

  • GPT-4-Ausgaben -> bewertet von Claude
  • Claude-Ausgaben -> bewertet von GPT-4

Fallstrick 4: Sycophancy

Judges stimmen starken Meinungen in der Antwort zu. „Ich bin zu 100 % sicher ...“ erhält höhere Bewertungen als „Ich denke ...“. Entfernen Sie Selbstsicherheitsformulierungen vor der Bewertung.

Fallstrick 5: Bewertungsinflation

Bei Skalen von 1 bis 5 gruppieren Judges ihre Bewertungen um 4. Verwenden Sie eine binäre Bewertung (richtig/falsch) für ein klareres Signal:

judge_prompt = '... Return PASS or FAIL only ...'

Fallstrick 6: Formatverzerrung

Antworten in Form von Aufzählungen erhalten unabhängig von ihrer Richtigkeit höhere Bewertungen als Fließtext. Seien Sie sich dessen bewusst; manchmal sollten Sie ein Format vorgeben, um diese Variable zu entfernen.

An menschlichen Bewertungen kalibrieren

Messen Sie anhand einer Stichprobe, wie stark die Bewertungen des Judges mit menschlichen Bewertungen übereinstimmen:

from scipy.stats import pearsonr

human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this task

Wenn möglich paarweise vergleichen

„Ist A besser als B?“ ist zuverlässiger als „Bewerten Sie A von 1 bis 5“. Wenn Sie zwischen zwei Prompts wählen, ist ein paarweiser Vergleich besser als eine absolute Bewertung.

Chain-of-Thought-Bewertung

Lassen Sie den Judge zunächst schrittweise schlussfolgern:

judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.

Question: {q}
Reference: {r}
Answer: {a}
'''

Kosten

Die Bewertung mit GPT-4 verdoppelt die Evaluierungskosten. Verwenden Sie für Routineprüfungen günstigere Judges (gpt-4o-mini oder claude-haiku) und reservieren Sie leistungsstarke Judges für Releases.

Mit Regeln kombinieren

Verlassen Sie sich nicht nur auf den Judge. Kombinieren Sie:

  • Regeln („enthält ‚30 Tage‘“)
  • Heuristiken (Längenbereich)
  • LLM-Judge für den offenen Teil

Einen LLM-Judge kalibrieren

Wie prüfen Sie, ob Ihr LLM-Judge zuverlässig ist?

Zusammenfassung

LLM-Judges sind nützlich, aber voreingenommen. Vertauschen Sie Positionen zufällig, normalisieren Sie die Länge, verwenden Sie unterschiedliche Modellfamilien, kalibrieren Sie anhand menschlicher Bewertungen und kombinieren Sie die Bewertung mit festen Regeln.

Häufig gestellte Fragen

Ist die Lektion „Fallstricke bei LLM-as-a-Judge“ kostenlos?

Ja — der vollständige Text von „Fallstricke bei LLM-as-a-Judge“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Fallstricke bei LLM-as-a-Judge“?

Judes bevorzugen voreingenommen ausführliche Antworten, haben Schwierigkeiten mit ihren eigenen Ausgaben und müssen sorgfältig kalibriert werden. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.

Wie lange dauert die Lektion „Fallstricke bei LLM-as-a-Judge“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Eval-getriebene Entwicklung für Agents
  2. Einen Golden-Testdatensatz erstellen
  3. Fallstricke bei LLM-as-a-Judge
  4. Benchmark-Suites: SWE-Bench, GAIA, ToolBench
← Zurück zu AI Agents