Conjuntos de referência: SWE-Bench, GAIA, ToolBench
Conjuntos públicos de referência para agentes de programação (SWE-Bench), assistentes gerais (GAIA) e uso de ferramentas (ToolBench).
Conjuntos de referência: SWE-Bench, GAIA, ToolBench é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Partes desta aula ainda não foram traduzidas e aparecem em inglês.
Avaliações comparativas públicas
Para comparar modelos e estruturas entre equipes, as avaliações comparativas públicas são essenciais. Elas abrangem capacidades comuns de agentes:
- SWE-Bench — tarefas de engenharia de software
- GAIA — tarefas de assistente geral
- ToolBench / BFCL — uso de ferramentas
- WebArena — navegação no navegador
SWE-Bench
O SWE-Bench testa se um agente consegue resolver problemas reais do GitHub:
- 2294 problemas reais de repositórios Python populares
- O agente deve produzir um patch que passe em todos os testes ocultos
- Os principais agentes de fronteira agora resolvem de 50% a 70% (eram menos de 5% em 2023)
SWE-Bench Verified
A OpenAI lançou um subconjunto de 500 problemas com verificações de qualidade mais rigorosas (SWE-Bench Verified). Esse é o padrão do setor.
GAIA
Avaliação comparativa de assistente geral de IA (Meta + HF, 2023):
- 466 perguntas em três níveis de dificuldade
- Exige navegação, execução de código e raciocínio multimodal
- Foi projetada para que uma pessoa leve cerca de 30 segundos; os principais agentes chegam a aproximadamente 60%
Exemplo de pergunta do GAIA
"Quantos álbuns de estúdio de Mercedes Sosa foram publicados entre 1972 e 1985? Use a lista da página dela na Wikipédia em inglês."
Exige navegação, leitura de tabelas e contagem — tarefas típicas de agentes de várias etapas.
Classificação de chamadas de funções de Berkeley (BFCL)
O padrão para avaliar chamadas de ferramentas:
- Milhares de trios (consulta, definição da ferramenta, chamada esperada)
- Abrange cenários simples, paralelos e de ferramenta não utilizada
- Atualizado trimestralmente
ToolBench
Maior, mas mais desorganizado: mais de 16 mil APIs da RapidAPI e cadeias de ferramentas de várias etapas. Menos canônico que o BFCL, mas abrange uma variedade maior.
WebArena
Avaliação comparativa de código aberto para agentes de navegação na web. Hospeda quatro sites independentes (comércio eletrônico, fórum, portal de desenvolvimento e GitLab); os agentes devem concluir tarefas realistas.
Running SWE-Bench Locally
git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .
# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
--predictions_path my_agent_preds.json \
--max_workers 4Limitações das avaliações comparativas
- As avaliações comparativas públicas vazam para os dados de treinamento (risco de manipulação)
- Domínio único — sua tarefa pode ser mais difícil ou mais fácil
- "Resolva X%" esconde qual é esse X% — a cauda longa importa
Sua própria avaliação comparativa é mais importante
As avaliações comparativas públicas são úteis para comparar abordagens. Mas seu próprio conjunto de referência com os seus dados é o único número que importa para o seu produto.
Combinando avaliações internas e públicas
Prática saudável de equipe:
- Execute avaliações comparativas públicas trimestralmente para acompanhar a capacidade de ponta
- Execute avaliações internas em cada PR
- Confie nos números internos para tomar decisões e nos números públicos para acompanhar o setor
Interpretação dos resultados das avaliações comparativas
Quando um artigo diz "75% no SWE-Bench":
- Verifique WHICH SWE-Bench (Lite, Verified ou completo)
- Verifique se várias tentativas foram permitidas
- Verifique se foram usadas ferramentas ou dicas ocultas
É fácil interpretar números de destaque de forma equivocada.
Avaliações internas versus públicas
O que é mais importante para o seu produto?
Recapitulação
SWE-Bench para agentes de código, GAIA para assistentes gerais, BFCL para uso de ferramentas e WebArena para navegadores. Use-os para acompanhar o setor; confie na sua própria avaliação para tomar decisões.
Perguntas Frequentes
A aula “Conjuntos de referência: SWE-Bench, GAIA, ToolBench” é grátis?
Sim — o texto completo de “Conjuntos de referência: SWE-Bench, GAIA, ToolBench” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Conjuntos de referência: SWE-Bench, GAIA, ToolBench”?
Conjuntos públicos de referência para agentes de programação (SWE-Bench), assistentes gerais (GAIA) e uso de ferramentas (ToolBench). Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.
Quanto tempo leva a aula “Conjuntos de referência: SWE-Bench, GAIA, ToolBench”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Desenvolvimento de agentes orientado por avaliações
- Construindo um conjunto de testes de referência
- Armadilhas do LLM como avaliador
- Conjuntos de referência: SWE-Bench, GAIA, ToolBench