0Pricing
AI Agents · Leçon

Pièges des LLM-as-a-Judge

Les évaluateurs privilégient les réponses verbeuses, ont du mal à évaluer leurs propres sorties et nécessitent un étalonnage soigneux.

Pièges des LLM-as-a-Judge est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

Pourquoi des juges LLM ?

Pour les sorties ouvertes (dissertations, revues de code, réponses conversationnelles), il n’existe pas une seule bonne réponse. Embaucher des humains pour évaluer des milliers de sorties coûte cher.

Le jugement par LLM — utiliser un modèle puissant pour noter les sorties — comble cette lacune.

Basic LLM Judge

judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.

Question: {question}
Answer: {answer}
'''

Piège 1 : biais de position

Les juges préfèrent la réponse FIRST dans une comparaison par paires. Randomisez toujours l’ordre et exécutez la comparaison deux fois :

def fair_compare(a, b):
    score_ab = compare(a, b)
    score_ba = compare(b, a)   # swapped
    return (score_ab + score_ba) / 2

Piège 2 : biais de longueur

Les juges préfèrent les réponses LONGER, même lorsque les plus courtes sont meilleures. Étalonnez le juge en normalisant la longueur ou en lui donnant des consignes :

judge_prompt = '... Penalize answers that are verbose without adding value ...'

Piège 3 : préférence pour soi-même

Les modèles préfèrent leurs propres sorties. Si GPT-4 évalue son propre travail, il s’attribue une note supérieure à celle qu’il devrait obtenir. Utilisez une autre famille de modèles pour l’évaluation :

  • Sorties de GPT-4 -> évaluées par Claude
  • Sorties de Claude -> évaluées par GPT-4

Piège 4 : complaisance

Les juges adhèrent aux opinions affirmées dans la réponse. « J’en suis certain à 100 %... » obtient de meilleures notes que « Je pense que... ». Supprimez les expressions de confiance avant l’évaluation.

Piège 5 : inflation des notes

Sur les échelles de 1 à 5, les juges se regroupent autour de 4. Utilisez une notation binaire (correct/incorrect) pour obtenir un signal plus net :

judge_prompt = '... Return PASS or FAIL only ...'

Piège 6 : biais de format

Les réponses sous forme de liste à puces obtiennent de meilleures notes que la prose, quelle que soit leur exactitude. Tenez-en compte ; parfois, imposez un format pour éliminer cette variable.

Étalonner par rapport aux humains

Mesurez la corrélation entre les évaluations du juge et celles d’humains sur un échantillon :

from scipy.stats import pearsonr

human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this task

Utiliser des comparaisons par paires quand c’est possible

« A est-il meilleur que B ? » est plus fiable que « Notez A de 1 à 5 ». Pour choisir entre deux prompts, une comparaison par paires est préférable à une note absolue.

Évaluation par chaîne de pensée

Demandez d’abord au juge de raisonner :

judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.

Question: {q}
Reference: {r}
Answer: {a}
'''

Coût

Évaluer avec GPT-4 double le coût des évaluations. Pour les vérifications courantes, utilisez des juges moins chers (gpt-4o-mini ou claude-haiku) et réservez les grands juges aux mises en production.

Combiner avec des règles

Ne vous fiez pas uniquement au juge. Combinez :

  • Des règles (« contient “30 jours” »)
  • Des heuristiques (plage de longueur)
  • Un juge LLM pour la partie ouverte

Étalonner un juge LLM

Comment vérifier que votre juge LLM est fiable ?

Récapitulatif

Les juges LLM sont utiles, mais biaisés. Randomisez les positions, normalisez la longueur, utilisez des familles de modèles différentes, étalonnez-les par rapport aux humains et combinez-les avec des règles strictes.

Questions Fréquemment Posées

La leçon « Pièges des LLM-as-a-Judge » est-elle gratuite ?

Oui — le texte complet de « Pièges des LLM-as-a-Judge » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Pièges des LLM-as-a-Judge » ?

Les évaluateurs privilégient les réponses verbeuses, ont du mal à évaluer leurs propres sorties et nécessitent un étalonnage soigneux. Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Agents ?

Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.

Combien de temps prend la leçon « Pièges des LLM-as-a-Judge » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?

Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Développement d’agents piloté par l’évaluation
  2. Construire un jeu de tests de référence
  3. Pièges des LLM-as-a-Judge
  4. Suites de référence : SWE-Bench, GAIA, ToolBench
← Retour à AI Agents