0Pricing
AI Agents · Aula

Desenvolvimento de agentes orientado por avaliações

Escreva a avaliação antes de colocar o agente em produção — é a única forma de iterar sem regressões.

Desenvolvimento de agentes orientado por avaliações é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Partes desta aula ainda não foram traduzidas e aparecem em inglês.

As avaliações são testes para IA

Você não lançaria código sem testes. A mesma lógica se aplica a agentes de LLM — sem avaliações, cada alteração é uma aposta.

Desenvolvimento orientado por avaliações (EDD) significa escrever a avaliação ANTES de lançar a alteração.

O ciclo de EDD

  1. Escreva uma avaliação que falhe: entrada + comportamento esperado
  2. Melhore o agente até a avaliação passar
  3. Adicione a avaliação ao seu conjunto
  4. Execute a cada alteração

O que avaliar

Para um agente, avalie em vários níveis:

  • Componente — o recuperador retorna os trechos corretos?
  • Etapa — o LLM escolhe a ferramenta correta?
  • De ponta a ponta — o agente produz a resposta final correta?

Dados de avaliação

Cada linha de avaliação contém, no mínimo:

eval_example = {
    'input': 'What is our return policy?',
    'expected_output': 'mentions 30-day window',
    'expected_tool_calls': ['retrieve'],
    'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
    print(f"{k}: {v}")

Run an Eval Suite

def run_evals(suite, agent):
    results = []
    for case in suite:
        actual = agent.run(case['input'])
        scores = [
            score_correctness(actual, case['expected_output']),
            score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
        ]
        results.append({'case': case, 'actual': actual, 'scores': scores})
    return results

Integração contínua

Execute avaliações em cada PR. Se a qualidade cair abaixo do limite, bloqueie a mesclagem:

# .github/workflows/evals.yml
on: pull_request
jobs:
  evals:
    runs-on: ubuntu-latest
    steps:
      - run: python -m evals.run --fail-below 0.85

Periodicidade das avaliações

  • Avaliações de componentes — cada PR
  • Avaliações de ponta a ponta — cada PR (com amostragem) + todas as noites (completas)
  • Rastreamentos de produção -> conjunto de avaliações — semanalmente

Fluxo de produção -> avaliação

Extraia rastreamentos reais. Resultados ruins tornam-se avaliações do dia seguinte:

for trace in production_traces_with_thumbs_down():
    add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)

Avaliação com LangSmith / Langfuse

As duas ferramentas têm suporte integrado a avaliações: versionamento de conjuntos de dados, funções de avaliação e visualizações de comparação.

Verificações manuais por amostragem

As avaliações automatizadas não percebem estilo e nuances. Periodicamente, leia 20 rastreamentos aleatórios manualmente — isso detecta problemas que as avaliações não percebem.

Antipadrão: memorização do conjunto de avaliações

Se você ajustar o agente até ele passar na sua avaliação, mas ela for pequena, ocorrerá sobreajuste. Continue ampliando as avaliações e alterne as divisões entre teste e treinamento.

Manutenção do conjunto de avaliações

As avaliações mudam conforme seu produto muda. Adicione casos para novos recursos e retire casos de recursos removidos.

Definição de EDD

O que significa Desenvolvimento orientado por avaliações?

Recapitulação

O Desenvolvimento orientado por avaliações é indispensável para agentes sérios. Escreva avaliações em todos os níveis, execute-as na integração contínua e amplie seu conjunto a partir de rastreamentos de produção.

Perguntas Frequentes

A aula “Desenvolvimento de agentes orientado por avaliações” é grátis?

Sim — o texto completo de “Desenvolvimento de agentes orientado por avaliações” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Desenvolvimento de agentes orientado por avaliações”?

Escreva a avaliação antes de colocar o agente em produção — é a única forma de iterar sem regressões. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.

Quanto tempo leva a aula “Desenvolvimento de agentes orientado por avaliações”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Desenvolvimento de agentes orientado por avaliações
  2. Construindo um conjunto de testes de referência
  3. Armadilhas do LLM como avaliador
  4. Conjuntos de referência: SWE-Bench, GAIA, ToolBench
← Voltar para AI Agents