0Pricing
AI Agents · Leçon

Suites de référence : SWE-Bench, GAIA, ToolBench

Découvrez les références publiques pour les agents de programmation (SWE-Bench), les assistants généralistes (GAIA) et l’utilisation d’outils (ToolBench).

Suites de référence : SWE-Bench, GAIA, ToolBench est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

Évaluations publiques

Pour comparer des modèles et des environnements entre équipes, les évaluations publiques sont indispensables. Elles couvrent les capacités courantes des agents :

  • SWE-Bench — tâches de développement logiciel
  • GAIA — tâches d’assistant généraliste
  • ToolBench / BFCL — utilisation d’outils
  • WebArena — navigation dans un navigateur

SWE-Bench

SWE-Bench vérifie si un agent peut résoudre de vrais problèmes GitHub :

  • 2 294 problèmes réels issus de dépôts Python populaires
  • L’agent doit produire un correctif qui réussit tous les tests cachés
  • Les meilleurs agents de pointe en résolvent désormais 50 à 70 % (contre moins de 5 % en 2023)

SWE-Bench Verified

OpenAI a publié un sous-ensemble de 500 problèmes soumis à des contrôles de qualité plus stricts (SWE-Bench Verified). Il s’agit de la référence du secteur.

GAIA

Évaluation des assistants d’IA généralistes (Meta + HF, 2023) :

  • 466 questions réparties sur trois niveaux de difficulté
  • Nécessite de naviguer sur le Web, d’exécuter du code et de raisonner en multimodal
  • Conçue pour qu’un humain mette environ 30 secondes ; les meilleurs agents atteignent environ 60 %

Exemple de question GAIA

« Combien d’albums studio de Mercedes Sosa ont été publiés entre 1972 et 1985 ? Utilisez la liste de sa page Wikipédia en anglais. »

Cette question nécessite de naviguer sur le Web, de lire un tableau et de compter — des opérations typiques des tâches d’agents à plusieurs étapes.

Classement Berkeley des appels de fonctions (BFCL)

La référence pour l’évaluation des appels d’outils :

  • Des milliers de triplets (requête, définition de l’outil, appel attendu)
  • Couvre les scénarios simples, parallèles et sans outil alors qu’un outil était nécessaire
  • Mis à jour chaque trimestre

ToolBench

Plus vaste, mais moins propre : plus de 16 000 API issues de RapidAPI, avec des chaînes d’outils à plusieurs étapes. Moins canonique que BFCL, mais couvre un éventail plus large.

WebArena

Évaluation open source pour les agents de navigation Web. Elle héberge 4 sites autonomes (commerce en ligne, forum, portail de développement, GitLab) ; les agents doivent accomplir des tâches réalistes.

Running SWE-Bench Locally

git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .

# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
    --predictions_path my_agent_preds.json \
    --max_workers 4

Limites des évaluations

  • Les évaluations publiques finissent dans les données d’entraînement (risque d’optimisation artificielle)
  • Un seul domaine — votre tâche peut être plus difficile ou plus facile
  • « Résoudre X % » masque la nature de ces X % — la longue traîne compte

Votre propre évaluation est plus importante

Les évaluations publiques sont utiles pour comparer les approches. Mais votre propre ensemble de référence sur vos données, YOUR données, est le seul chiffre qui compte pour votre produit.

Combiner évaluations internes et publiques

Bonne pratique d’équipe :

  • Exécutez les évaluations publiques chaque trimestre pour suivre les capacités de pointe
  • Exécutez les évaluations internes à chaque PR
  • Fiez-vous aux chiffres internes pour prendre des décisions et aux chiffres publics pour suivre le secteur

Lire les résultats d’une évaluation comparative

Lorsqu’un article affirme « 75 % sur SWE-Bench » :

  • Vérifiez WHICH SWE-Bench (Lite, Verified, complet)
  • Vérifiez si plusieurs tentatives étaient autorisées
  • Vérifiez si des outils ou des indications cachés ont été utilisés

Les chiffres mis en avant sont faciles à mal interpréter.

Évaluations internes ou publiques

Qu’est-ce qui compte le plus pour votre produit ?

Récapitulatif

SWE-Bench pour les agents de code, GAIA pour les assistants généralistes, BFCL pour l’utilisation d’outils et WebArena pour les navigateurs. Utilisez-les pour suivre le secteur ; fiez-vous à votre propre évaluation pour prendre vos décisions.

Questions Fréquemment Posées

La leçon « Suites de référence : SWE-Bench, GAIA, ToolBench » est-elle gratuite ?

Oui — le texte complet de « Suites de référence : SWE-Bench, GAIA, ToolBench » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Suites de référence : SWE-Bench, GAIA, ToolBench » ?

Découvrez les références publiques pour les agents de programmation (SWE-Bench), les assistants généralistes (GAIA) et l’utilisation d’outils (ToolBench). Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Agents ?

Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.

Combien de temps prend la leçon « Suites de référence : SWE-Bench, GAIA, ToolBench » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?

Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Développement d’agents piloté par l’évaluation
  2. Construire un jeu de tests de référence
  3. Pièges des LLM-as-a-Judge
  4. Suites de référence : SWE-Bench, GAIA, ToolBench
← Retour à AI Agents