Problemi degli LLM-as-a-Judge
I valutatori tendono a preferire risposte prolisse, hanno difficoltà con i propri output e richiedono un'attenta calibrazione.
Problemi degli LLM-as-a-Judge è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.
Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.
Perché usare valutatori LLM?
Per gli output aperti (saggi, revisioni del codice, risposte conversazionali) non esiste un'unica risposta corretta. Assumere persone per valutare migliaia di output è costoso.
LLM-as-a-Judge — usare un modello avanzato per assegnare un punteggio agli output — colma questa lacuna.
Basic LLM Judge
judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.
Question: {question}
Answer: {answer}
'''Problema 1: bias di posizione
I valutatori preferiscono la PRIMA risposta nei confronti a coppie. Renda sempre casuale l'ordine ed esegua il confronto due volte:
def fair_compare(a, b):
score_ab = compare(a, b)
score_ba = compare(b, a) # swapped
return (score_ab + score_ba) / 2Problema 2: bias di lunghezza
I valutatori preferiscono le risposte PIÙ LUNGHE, anche quando quelle più brevi sono migliori. Esegua la calibrazione normalizzando la lunghezza o fornendo istruzioni al valutatore:
judge_prompt = '... Penalize answers that are verbose without adding value ...'Problema 3: preferenza per sé stessi
I modelli preferiscono i propri output. Se GPT-4 valuta il proprio lavoro, gli assegna un punteggio più alto del dovuto. Per la valutazione utilizzi una famiglia di modelli diversa:
- Output di GPT-4 -> valutati da Claude
- Output di Claude -> valutati da GPT-4
Problema 4: compiacenza
I valutatori concordano con le opinioni espresse con sicurezza nella risposta. "Ne sono sicuro al 100%..." riceve punteggi più alti di "Penso che...". Rimuova le espressioni di sicurezza prima della valutazione.
Problema 5: inflazione dei punteggi
Nelle scale da 1 a 5, i valutatori si concentrano intorno a 4. Utilizzi un punteggio binario (corretto/errato) per ottenere un segnale più netto:
judge_prompt = '... Return PASS or FAIL only ...'Problema 6: bias del formato
Le risposte in elenchi puntati ricevono punteggi più alti della prosa, indipendentemente dalla correttezza. Ne tenga conto; a volte imponga un formato per eliminare questa variabile.
Calibrazione rispetto alle persone
Misuri quanto il valutatore sia correlato alle valutazioni umane su un campione:
from scipy.stats import pearsonr
human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this taskUtilizzi il confronto a coppie quando possibile
"A è migliore di B?" è più affidabile di "Assegni ad A un punteggio da 1 a 5". Quando deve scegliere tra due prompt, preferisca il confronto a coppie al punteggio assoluto.
Valutazione con Chain-of-Thought
Faccia ragionare prima il valutatore:
judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.
Question: {q}
Reference: {r}
Answer: {a}
'''Costo
Valutare con GPT-4 raddoppia il costo degli eval. Per i controlli di routine, utilizzi valutatori meno costosi (gpt-4o-mini o claude-haiku) e riservi i valutatori più avanzati alle release.
Combini con le regole
Non si affidi soltanto al valutatore. Combini:
- Regole ("contiene '30 giorni'")
- Euristiche (intervallo di lunghezza)
- Valutatore LLM per la parte aperta
Calibrazione di un valutatore LLM
Come si verifica se il proprio valutatore LLM è affidabile?
Riepilogo
I valutatori LLM sono utili, ma soggetti a bias. Renda casuali le posizioni, normalizzi la lunghezza, utilizzi famiglie di modelli diverse, esegua la calibrazione rispetto alle persone e combini il tutto con regole rigide.
Domande Frequenti
La lezione «Problemi degli LLM-as-a-Judge» è gratuita?
Sì — il testo completo di «Problemi degli LLM-as-a-Judge» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.
Cosa imparerò in «Problemi degli LLM-as-a-Judge»?
I valutatori tendono a preferire risposte prolisse, hanno difficoltà con i propri output e richiedono un'attenta calibrazione. Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare AI Agents?
Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.
Quanto tempo richiede la lezione «Problemi degli LLM-as-a-Judge»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione AI Agents?
Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Sviluppo degli agenti guidato dalle valutazioni
- Creare un set di test di riferimento
- Problemi degli LLM-as-a-Judge
- Suite di benchmark: SWE-Bench, GAIA, ToolBench