0Pricing
AI Agents · Lezione

Problemi degli LLM-as-a-Judge

I valutatori tendono a preferire risposte prolisse, hanno difficoltà con i propri output e richiedono un'attenta calibrazione.

Problemi degli LLM-as-a-Judge è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.

Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.

Perché usare valutatori LLM?

Per gli output aperti (saggi, revisioni del codice, risposte conversazionali) non esiste un'unica risposta corretta. Assumere persone per valutare migliaia di output è costoso.

LLM-as-a-Judge — usare un modello avanzato per assegnare un punteggio agli output — colma questa lacuna.

Basic LLM Judge

judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.

Question: {question}
Answer: {answer}
'''

Problema 1: bias di posizione

I valutatori preferiscono la PRIMA risposta nei confronti a coppie. Renda sempre casuale l'ordine ed esegua il confronto due volte:

def fair_compare(a, b):
    score_ab = compare(a, b)
    score_ba = compare(b, a)   # swapped
    return (score_ab + score_ba) / 2

Problema 2: bias di lunghezza

I valutatori preferiscono le risposte PIÙ LUNGHE, anche quando quelle più brevi sono migliori. Esegua la calibrazione normalizzando la lunghezza o fornendo istruzioni al valutatore:

judge_prompt = '... Penalize answers that are verbose without adding value ...'

Problema 3: preferenza per sé stessi

I modelli preferiscono i propri output. Se GPT-4 valuta il proprio lavoro, gli assegna un punteggio più alto del dovuto. Per la valutazione utilizzi una famiglia di modelli diversa:

  • Output di GPT-4 -> valutati da Claude
  • Output di Claude -> valutati da GPT-4

Problema 4: compiacenza

I valutatori concordano con le opinioni espresse con sicurezza nella risposta. "Ne sono sicuro al 100%..." riceve punteggi più alti di "Penso che...". Rimuova le espressioni di sicurezza prima della valutazione.

Problema 5: inflazione dei punteggi

Nelle scale da 1 a 5, i valutatori si concentrano intorno a 4. Utilizzi un punteggio binario (corretto/errato) per ottenere un segnale più netto:

judge_prompt = '... Return PASS or FAIL only ...'

Problema 6: bias del formato

Le risposte in elenchi puntati ricevono punteggi più alti della prosa, indipendentemente dalla correttezza. Ne tenga conto; a volte imponga un formato per eliminare questa variabile.

Calibrazione rispetto alle persone

Misuri quanto il valutatore sia correlato alle valutazioni umane su un campione:

from scipy.stats import pearsonr

human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this task

Utilizzi il confronto a coppie quando possibile

"A è migliore di B?" è più affidabile di "Assegni ad A un punteggio da 1 a 5". Quando deve scegliere tra due prompt, preferisca il confronto a coppie al punteggio assoluto.

Valutazione con Chain-of-Thought

Faccia ragionare prima il valutatore:

judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.

Question: {q}
Reference: {r}
Answer: {a}
'''

Costo

Valutare con GPT-4 raddoppia il costo degli eval. Per i controlli di routine, utilizzi valutatori meno costosi (gpt-4o-mini o claude-haiku) e riservi i valutatori più avanzati alle release.

Combini con le regole

Non si affidi soltanto al valutatore. Combini:

  • Regole ("contiene '30 giorni'")
  • Euristiche (intervallo di lunghezza)
  • Valutatore LLM per la parte aperta

Calibrazione di un valutatore LLM

Come si verifica se il proprio valutatore LLM è affidabile?

Riepilogo

I valutatori LLM sono utili, ma soggetti a bias. Renda casuali le posizioni, normalizzi la lunghezza, utilizzi famiglie di modelli diverse, esegua la calibrazione rispetto alle persone e combini il tutto con regole rigide.

Domande Frequenti

La lezione «Problemi degli LLM-as-a-Judge» è gratuita?

Sì — il testo completo di «Problemi degli LLM-as-a-Judge» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.

Cosa imparerò in «Problemi degli LLM-as-a-Judge»?

I valutatori tendono a preferire risposte prolisse, hanno difficoltà con i propri output e richiedono un'attenta calibrazione. Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Agents?

Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.

Quanto tempo richiede la lezione «Problemi degli LLM-as-a-Judge»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Agents?

Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Sviluppo degli agenti guidato dalle valutazioni
  2. Creare un set di test di riferimento
  3. Problemi degli LLM-as-a-Judge
  4. Suite di benchmark: SWE-Bench, GAIA, ToolBench
← Torna a AI Agents