Desenvolvimento de agentes orientado por avaliações
Escreva a avaliação antes de colocar o agente em produção — é a única forma de iterar sem regressões.
Desenvolvimento de agentes orientado por avaliações é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Partes desta aula ainda não foram traduzidas e aparecem em inglês.
As avaliações são testes para IA
Você não lançaria código sem testes. A mesma lógica se aplica a agentes de LLM — sem avaliações, cada alteração é uma aposta.
Desenvolvimento orientado por avaliações (EDD) significa escrever a avaliação ANTES de lançar a alteração.
O ciclo de EDD
- Escreva uma avaliação que falhe: entrada + comportamento esperado
- Melhore o agente até a avaliação passar
- Adicione a avaliação ao seu conjunto
- Execute a cada alteração
O que avaliar
Para um agente, avalie em vários níveis:
- Componente — o recuperador retorna os trechos corretos?
- Etapa — o LLM escolhe a ferramenta correta?
- De ponta a ponta — o agente produz a resposta final correta?
Dados de avaliação
Cada linha de avaliação contém, no mínimo:
eval_example = {
'input': 'What is our return policy?',
'expected_output': 'mentions 30-day window',
'expected_tool_calls': ['retrieve'],
'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
print(f"{k}: {v}")
Run an Eval Suite
def run_evals(suite, agent):
results = []
for case in suite:
actual = agent.run(case['input'])
scores = [
score_correctness(actual, case['expected_output']),
score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
]
results.append({'case': case, 'actual': actual, 'scores': scores})
return resultsIntegração contínua
Execute avaliações em cada PR. Se a qualidade cair abaixo do limite, bloqueie a mesclagem:
# .github/workflows/evals.yml
on: pull_request
jobs:
evals:
runs-on: ubuntu-latest
steps:
- run: python -m evals.run --fail-below 0.85Periodicidade das avaliações
- Avaliações de componentes — cada PR
- Avaliações de ponta a ponta — cada PR (com amostragem) + todas as noites (completas)
- Rastreamentos de produção -> conjunto de avaliações — semanalmente
Fluxo de produção -> avaliação
Extraia rastreamentos reais. Resultados ruins tornam-se avaliações do dia seguinte:
for trace in production_traces_with_thumbs_down():
add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)Avaliação com LangSmith / Langfuse
As duas ferramentas têm suporte integrado a avaliações: versionamento de conjuntos de dados, funções de avaliação e visualizações de comparação.
Verificações manuais por amostragem
As avaliações automatizadas não percebem estilo e nuances. Periodicamente, leia 20 rastreamentos aleatórios manualmente — isso detecta problemas que as avaliações não percebem.
Antipadrão: memorização do conjunto de avaliações
Se você ajustar o agente até ele passar na sua avaliação, mas ela for pequena, ocorrerá sobreajuste. Continue ampliando as avaliações e alterne as divisões entre teste e treinamento.
Manutenção do conjunto de avaliações
As avaliações mudam conforme seu produto muda. Adicione casos para novos recursos e retire casos de recursos removidos.
Definição de EDD
O que significa Desenvolvimento orientado por avaliações?
Recapitulação
O Desenvolvimento orientado por avaliações é indispensável para agentes sérios. Escreva avaliações em todos os níveis, execute-as na integração contínua e amplie seu conjunto a partir de rastreamentos de produção.
Perguntas Frequentes
A aula “Desenvolvimento de agentes orientado por avaliações” é grátis?
Sim — o texto completo de “Desenvolvimento de agentes orientado por avaliações” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Desenvolvimento de agentes orientado por avaliações”?
Escreva a avaliação antes de colocar o agente em produção — é a única forma de iterar sem regressões. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.
Quanto tempo leva a aula “Desenvolvimento de agentes orientado por avaliações”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Desenvolvimento de agentes orientado por avaliações
- Construindo um conjunto de testes de referência
- Armadilhas do LLM como avaliador
- Conjuntos de referência: SWE-Bench, GAIA, ToolBench