Armadilhas do LLM como avaliador
Os avaliadores são tendenciosos em favor de respostas verbosas, têm dificuldade com as próprias saídas e precisam de calibração cuidadosa.
Armadilhas do LLM como avaliador é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Partes desta aula ainda não foram traduzidas e aparecem em inglês.
Por que usar juízes de LLM?
Para saídas abertas (ensaios, revisões de código e respostas conversacionais), não existe uma única resposta correta. Contratar pessoas para avaliar milhares de saídas é caro.
LLM como juiz — usar um modelo forte para pontuar saídas — preenche essa lacuna.
Basic LLM Judge
judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.
Question: {question}
Answer: {answer}
'''Problema 1: viés de posição
Os avaliadores preferem a resposta FIRST em uma comparação entre pares. Sempre aleatorize a ordem e execute duas vezes:
def fair_compare(a, b):
score_ab = compare(a, b)
score_ba = compare(b, a) # swapped
return (score_ab + score_ba) / 2Problema 2: viés de extensão
Os avaliadores preferem respostas LONGER, mesmo quando as mais curtas são melhores. Faça a calibração normalizando o tamanho ou instruindo o avaliador:
judge_prompt = '... Penalize answers that are verbose without adding value ...'Problema 3: autopreferência
Os modelos preferem suas próprias saídas. Se o GPT-4 avaliar o próprio trabalho, ele atribuirá a si uma pontuação maior do que deveria. Use uma família de modelos diferente para a avaliação:
- Saídas do GPT-4 -> avaliadas pelo Claude
- Saídas do Claude -> avaliadas pelo GPT-4
Problema 4: bajulação
Os avaliadores concordam com opiniões fortes presentes na resposta. "Tenho 100% de certeza..." recebe pontuações maiores que "Acho que...". Remova palavras que expressem confiança antes da avaliação.
Problema 5: inflação de pontuação
Em escalas de 1 a 5, os avaliadores se concentram em torno de 4. Use pontuação binária (correto/incorreto) para obter um sinal mais nítido:
judge_prompt = '... Return PASS or FAIL only ...'Problema 6: viés de formato
Respostas em listas com marcadores recebem pontuações maiores que textos corridos, independentemente da correção. Esteja atento; às vezes, estabeleça um formato para remover essa variável.
Faça a calibração com pessoas
Meça o quanto o avaliador se correlaciona com as classificações humanas em uma amostra:
from scipy.stats import pearsonr
human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this taskUse comparações entre pares quando possível
"A é melhor que B?" é mais confiável que "Dê uma pontuação de 1 a 5 para A". Ao escolher entre duas instruções, comparação entre pares > valor absoluto.
Avaliação com cadeia de pensamento
Faça o avaliador raciocinar primeiro:
judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.
Question: {q}
Reference: {r}
Answer: {a}
'''Custo
Avaliar com GPT-4 dobra o custo das avaliações. Para verificações rotineiras, use avaliadores mais baratos (gpt-4o-mini ou claude-haiku) e reserve os avaliadores grandes para os lançamentos.
Combine com regras
Não dependa somente do avaliador. Combine:
- Regras ("contém '30 dias'")
- Heurísticas (intervalo de tamanho)
- Avaliador de LLM para a parte aberta
Calibração de um avaliador de LLM
Como verificar se o seu avaliador de LLM é confiável?
Recapitulação
Os avaliadores de LLM são úteis, mas têm vieses. Aleatorize as posições, normalize o tamanho, use famílias de modelos diferentes, faça a calibração com pessoas e combine com regras rígidas.
Perguntas Frequentes
A aula “Armadilhas do LLM como avaliador” é grátis?
Sim — o texto completo de “Armadilhas do LLM como avaliador” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Armadilhas do LLM como avaliador”?
Os avaliadores são tendenciosos em favor de respostas verbosas, têm dificuldade com as próprias saídas e precisam de calibração cuidadosa. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.
Quanto tempo leva a aula “Armadilhas do LLM como avaliador”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Desenvolvimento de agentes orientado por avaliações
- Construindo um conjunto de testes de referência
- Armadilhas do LLM como avaliador
- Conjuntos de referência: SWE-Bench, GAIA, ToolBench