AI-agenten · Les

Valkuilen van LLM-as-a-Judge

Beoordelaars zijn bevooroordeeld ten gunste van uitvoerige antwoorden, hebben moeite met hun eigen uitvoer en vereisen zorgvuldige kalibratie.

Les 3 van 415 stappen

Valkuilen van LLM-as-a-Judge is een gratis AI-agenten-les op CoddyKit. Dit is les 3 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject AI-agenten. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus AI-agenten bevat in totaal 4 lessen.

Delen van deze les zijn nog niet vertaald en worden in het Engels weergegeven.

Waarom LLM-beoordelaars?

Voor open uitvoer (opstellen, codebeoordelingen en gesprekantwoorden) bestaat er niet één juist antwoord. Mensen inhuren om duizenden uitvoerresultaten te beoordelen is duur.

Een LLM als beoordelaar — een sterk model gebruiken om uitvoer te beoordelen — vult die leemte.

Basic LLM Judge

judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.

Question: {question}
Answer: {answer}
'''

Valkuil 1: positievoorkeur

Beoordelaars geven de voorkeur aan het EERSTE antwoord in een paarsgewijze vergelijking. Maak de volgorde altijd willekeurig en voer de vergelijking twee keer uit:

def fair_compare(a, b):
    score_ab = compare(a, b)
    score_ba = compare(b, a)   # swapped
    return (score_ab + score_ba) / 2

Valkuil 2: lengtevoorkeur

Beoordelaars geven de voorkeur aan LANGERE antwoorden, zelfs wanneer kortere antwoorden beter zijn. Kalibreer door te normaliseren of door de beoordelaar instructies te geven:

judge_prompt = '... Penalize answers that are verbose without adding value ...'

Valkuil 3: voorkeur voor zichzelf

Modellen geven de voorkeur aan hun eigen uitvoer. Als GPT-4 zijn eigen werk beoordeelt, geeft het zichzelf een hogere score dan terecht is. Gebruik voor de beoordeling een andere modelfamilie:

  • Uitvoer van GPT-4 -> beoordeeld door Claude
  • Uitvoer van Claude -> beoordeeld door GPT-4

Valkuil 4: meegaandheid

Beoordelaars zijn het eens met stellige meningen in het antwoord. "Ik weet het 100% zeker..." krijgt hogere scores dan "Ik denk...". Verwijder woorden die zekerheid uitdrukken voordat je beoordeelt.

Valkuil 5: score-inflatie

Op schalen van 1 tot 5 clusteren beoordelaars rond 4. Gebruik binaire beoordeling (juist/onjuist) voor een duidelijker signaal:

judge_prompt = '... Return PASS or FAIL only ...'

Valkuil 6: formatbias

Antwoorden in opsommingen krijgen een hogere score dan proza, ongeacht de juistheid. Houd hier rekening mee; schrijf soms een format voor om deze variabele weg te nemen.

Kalibreer aan de hand van mensen

Meet hoe sterk de beoordeling overeenkomt met menselijke beoordelingen op basis van een steekproef:

from scipy.stats import pearsonr

human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this task

Gebruik paarsgewijze vergelijking waar mogelijk

"Is A beter dan B?" is betrouwbaarder dan "Geef A een score van 1 tot 5". Gebruik bij het kiezen tussen twee prompts een paarsgewijze vergelijking in plaats van een absolute beoordeling.

Beoordelen met denkstappen

Laat de beoordelaar eerst redeneren:

judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.

Question: {q}
Reference: {r}
Answer: {a}
'''

Kosten

Beoordelen met GPT-4 verdubbelt de evaluatiekosten. Gebruik voor routinecontroles goedkopere beoordelaars (gpt-4o-mini of claude-haiku) en bewaar grote beoordelaars voor releases.

Combineer met regels

Vertrouw niet alleen op de beoordelaar. Combineer:

  • Regels ("bevat '30 dagen'")
  • Heuristieken (lengtebereik)
  • Een LLM-beoordelaar voor het open gedeelte

Een LLM-beoordelaar kalibreren

Hoe controleer je of je LLM-beoordelaar betrouwbaar is?

Samenvatting

LLM-beoordelaars zijn nuttig maar bevooroordeeld. Maak posities willekeurig, normaliseer de lengte, gebruik verschillende modelfamilies, kalibreer aan de hand van mensen en combineer met harde regels.

Gratis beginnen

Leer AI-agenten met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
60
Lessen
239

Veelgestelde vragen

Is de les “Valkuilen van LLM-as-a-Judge” gratis?

Ja — de volledige tekst van “Valkuilen van LLM-as-a-Judge” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus AI-agenten wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus AI-agenten bevat in totaal 4 lessen.

Wat leer ik in “Valkuilen van LLM-as-a-Judge”?

Beoordelaars zijn bevooroordeeld ten gunste van uitvoerige antwoorden, hebben moeite met hun eigen uitvoer en vereisen zorgvuldige kalibratie. Je oefent met AI-agenten door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met AI-agenten te beginnen?

Ervaring vooraf is niet nodig. AI-agenten op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 3 van 4.

Hoe lang duurt de les “Valkuilen van LLM-as-a-Judge”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over AI-agenten?

Ja. Elke les over AI-agenten bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Eval-gestuurde ontwikkeling voor agents
  2. Een gouden testset bouwen
  3. Valkuilen van LLM-as-a-Judge
  4. Benchmarksuites: SWE-Bench, GAIA, ToolBench
← Terug naar AI-agenten