0Pricing
AI Agents · Aula

Armadilhas do LLM como avaliador

Os avaliadores são tendenciosos em favor de respostas verbosas, têm dificuldade com as próprias saídas e precisam de calibração cuidadosa.

Armadilhas do LLM como avaliador é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Partes desta aula ainda não foram traduzidas e aparecem em inglês.

Por que usar juízes de LLM?

Para saídas abertas (ensaios, revisões de código e respostas conversacionais), não existe uma única resposta correta. Contratar pessoas para avaliar milhares de saídas é caro.

LLM como juiz — usar um modelo forte para pontuar saídas — preenche essa lacuna.

Basic LLM Judge

judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.

Question: {question}
Answer: {answer}
'''

Problema 1: viés de posição

Os avaliadores preferem a resposta FIRST em uma comparação entre pares. Sempre aleatorize a ordem e execute duas vezes:

def fair_compare(a, b):
    score_ab = compare(a, b)
    score_ba = compare(b, a)   # swapped
    return (score_ab + score_ba) / 2

Problema 2: viés de extensão

Os avaliadores preferem respostas LONGER, mesmo quando as mais curtas são melhores. Faça a calibração normalizando o tamanho ou instruindo o avaliador:

judge_prompt = '... Penalize answers that are verbose without adding value ...'

Problema 3: autopreferência

Os modelos preferem suas próprias saídas. Se o GPT-4 avaliar o próprio trabalho, ele atribuirá a si uma pontuação maior do que deveria. Use uma família de modelos diferente para a avaliação:

  • Saídas do GPT-4 -> avaliadas pelo Claude
  • Saídas do Claude -> avaliadas pelo GPT-4

Problema 4: bajulação

Os avaliadores concordam com opiniões fortes presentes na resposta. "Tenho 100% de certeza..." recebe pontuações maiores que "Acho que...". Remova palavras que expressem confiança antes da avaliação.

Problema 5: inflação de pontuação

Em escalas de 1 a 5, os avaliadores se concentram em torno de 4. Use pontuação binária (correto/incorreto) para obter um sinal mais nítido:

judge_prompt = '... Return PASS or FAIL only ...'

Problema 6: viés de formato

Respostas em listas com marcadores recebem pontuações maiores que textos corridos, independentemente da correção. Esteja atento; às vezes, estabeleça um formato para remover essa variável.

Faça a calibração com pessoas

Meça o quanto o avaliador se correlaciona com as classificações humanas em uma amostra:

from scipy.stats import pearsonr

human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this task

Use comparações entre pares quando possível

"A é melhor que B?" é mais confiável que "Dê uma pontuação de 1 a 5 para A". Ao escolher entre duas instruções, comparação entre pares > valor absoluto.

Avaliação com cadeia de pensamento

Faça o avaliador raciocinar primeiro:

judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.

Question: {q}
Reference: {r}
Answer: {a}
'''

Custo

Avaliar com GPT-4 dobra o custo das avaliações. Para verificações rotineiras, use avaliadores mais baratos (gpt-4o-mini ou claude-haiku) e reserve os avaliadores grandes para os lançamentos.

Combine com regras

Não dependa somente do avaliador. Combine:

  • Regras ("contém '30 dias'")
  • Heurísticas (intervalo de tamanho)
  • Avaliador de LLM para a parte aberta

Calibração de um avaliador de LLM

Como verificar se o seu avaliador de LLM é confiável?

Recapitulação

Os avaliadores de LLM são úteis, mas têm vieses. Aleatorize as posições, normalize o tamanho, use famílias de modelos diferentes, faça a calibração com pessoas e combine com regras rígidas.

Perguntas Frequentes

A aula “Armadilhas do LLM como avaliador” é grátis?

Sim — o texto completo de “Armadilhas do LLM como avaliador” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Armadilhas do LLM como avaliador”?

Os avaliadores são tendenciosos em favor de respostas verbosas, têm dificuldade com as próprias saídas e precisam de calibração cuidadosa. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.

Quanto tempo leva a aula “Armadilhas do LLM como avaliador”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Desenvolvimento de agentes orientado por avaliações
  2. Construindo um conjunto de testes de referência
  3. Armadilhas do LLM como avaliador
  4. Conjuntos de referência: SWE-Bench, GAIA, ToolBench
← Voltar para AI Agents