0Pricing
AI Agents · Aula

Conjuntos de referência: SWE-Bench, GAIA, ToolBench

Conjuntos públicos de referência para agentes de programação (SWE-Bench), assistentes gerais (GAIA) e uso de ferramentas (ToolBench).

Conjuntos de referência: SWE-Bench, GAIA, ToolBench é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Partes desta aula ainda não foram traduzidas e aparecem em inglês.

Avaliações comparativas públicas

Para comparar modelos e estruturas entre equipes, as avaliações comparativas públicas são essenciais. Elas abrangem capacidades comuns de agentes:

  • SWE-Bench — tarefas de engenharia de software
  • GAIA — tarefas de assistente geral
  • ToolBench / BFCL — uso de ferramentas
  • WebArena — navegação no navegador

SWE-Bench

O SWE-Bench testa se um agente consegue resolver problemas reais do GitHub:

  • 2294 problemas reais de repositórios Python populares
  • O agente deve produzir um patch que passe em todos os testes ocultos
  • Os principais agentes de fronteira agora resolvem de 50% a 70% (eram menos de 5% em 2023)

SWE-Bench Verified

A OpenAI lançou um subconjunto de 500 problemas com verificações de qualidade mais rigorosas (SWE-Bench Verified). Esse é o padrão do setor.

GAIA

Avaliação comparativa de assistente geral de IA (Meta + HF, 2023):

  • 466 perguntas em três níveis de dificuldade
  • Exige navegação, execução de código e raciocínio multimodal
  • Foi projetada para que uma pessoa leve cerca de 30 segundos; os principais agentes chegam a aproximadamente 60%

Exemplo de pergunta do GAIA

"Quantos álbuns de estúdio de Mercedes Sosa foram publicados entre 1972 e 1985? Use a lista da página dela na Wikipédia em inglês."

Exige navegação, leitura de tabelas e contagem — tarefas típicas de agentes de várias etapas.

Classificação de chamadas de funções de Berkeley (BFCL)

O padrão para avaliar chamadas de ferramentas:

  • Milhares de trios (consulta, definição da ferramenta, chamada esperada)
  • Abrange cenários simples, paralelos e de ferramenta não utilizada
  • Atualizado trimestralmente

ToolBench

Maior, mas mais desorganizado: mais de 16 mil APIs da RapidAPI e cadeias de ferramentas de várias etapas. Menos canônico que o BFCL, mas abrange uma variedade maior.

WebArena

Avaliação comparativa de código aberto para agentes de navegação na web. Hospeda quatro sites independentes (comércio eletrônico, fórum, portal de desenvolvimento e GitLab); os agentes devem concluir tarefas realistas.

Running SWE-Bench Locally

git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .

# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
    --predictions_path my_agent_preds.json \
    --max_workers 4

Limitações das avaliações comparativas

  • As avaliações comparativas públicas vazam para os dados de treinamento (risco de manipulação)
  • Domínio único — sua tarefa pode ser mais difícil ou mais fácil
  • "Resolva X%" esconde qual é esse X% — a cauda longa importa

Sua própria avaliação comparativa é mais importante

As avaliações comparativas públicas são úteis para comparar abordagens. Mas seu próprio conjunto de referência com os seus dados é o único número que importa para o seu produto.

Combinando avaliações internas e públicas

Prática saudável de equipe:

  • Execute avaliações comparativas públicas trimestralmente para acompanhar a capacidade de ponta
  • Execute avaliações internas em cada PR
  • Confie nos números internos para tomar decisões e nos números públicos para acompanhar o setor

Interpretação dos resultados das avaliações comparativas

Quando um artigo diz "75% no SWE-Bench":

  • Verifique WHICH SWE-Bench (Lite, Verified ou completo)
  • Verifique se várias tentativas foram permitidas
  • Verifique se foram usadas ferramentas ou dicas ocultas

É fácil interpretar números de destaque de forma equivocada.

Avaliações internas versus públicas

O que é mais importante para o seu produto?

Recapitulação

SWE-Bench para agentes de código, GAIA para assistentes gerais, BFCL para uso de ferramentas e WebArena para navegadores. Use-os para acompanhar o setor; confie na sua própria avaliação para tomar decisões.

Perguntas Frequentes

A aula “Conjuntos de referência: SWE-Bench, GAIA, ToolBench” é grátis?

Sim — o texto completo de “Conjuntos de referência: SWE-Bench, GAIA, ToolBench” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Conjuntos de referência: SWE-Bench, GAIA, ToolBench”?

Conjuntos públicos de referência para agentes de programação (SWE-Bench), assistentes gerais (GAIA) e uso de ferramentas (ToolBench). Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.

Quanto tempo leva a aula “Conjuntos de referência: SWE-Bench, GAIA, ToolBench”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Desenvolvimento de agentes orientado por avaliações
  2. Construindo um conjunto de testes de referência
  3. Armadilhas do LLM como avaliador
  4. Conjuntos de referência: SWE-Bench, GAIA, ToolBench
← Voltar para AI Agents