AI Agents · Lección

Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench

Pruebas comparativas públicas para agentes de programación (SWE-Bench), asistentes generales (GAIA) y uso de herramientas (ToolBench).

Lección 4 de 415 pasos

Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.

Partes de esta lección aún no han sido traducidas y se muestran en inglés.

Benchmarks públicos

Para comparar modelos y frameworks entre equipos, los benchmarks públicos son esenciales. Cubren capacidades habituales de los agentes:

  • SWE-Bench — tareas de ingeniería de software
  • GAIA — tareas de asistentes generales
  • ToolBench / BFCL — uso de herramientas
  • WebArena — navegación en el navegador

SWE-Bench

SWE-Bench comprueba si un agente puede resolver incidencias reales de GitHub:

  • 2294 incidencias reales de repositorios populares de Python
  • El agente debe producir un parche que supere todas las pruebas ocultas
  • Los agentes de vanguardia más avanzados ya resuelven entre el 50 % y el 70 % (frente a menos del 5 % en 2023)

SWE-Bench Verified

OpenAI publicó un subconjunto de 500 incidencias con controles de calidad más estrictos (SWE-Bench Verified). Es el estándar del sector.

GAIA

Benchmark de asistentes de IA general (Meta + HF, 2023):

  • 466 preguntas repartidas en tres niveles de dificultad
  • Requiere navegación web, ejecución de código y razonamiento multimodal
  • Está diseñado para que una persona tarde unos 30 segundos; los agentes más avanzados alcanzan aproximadamente el 60 %

Ejemplo de pregunta de GAIA

«¿Cuántos álbumes de estudio de Mercedes Sosa se publicaron entre 1972 y 1985? Use la lista de su página de Wikipedia en inglés».

Requiere navegar por la web, leer una tabla y contar, capacidades típicas de las tareas de agentes de varios pasos.

Berkeley Function Calling Leaderboard (BFCL)

El estándar para evaluar llamadas a herramientas:

  • Miles de ternas (consulta, definición de herramienta, llamada esperada)
  • Cubre escenarios sencillos, paralelos y de omisión de herramientas
  • Se actualiza trimestralmente

ToolBench

Es más grande, pero también más desordenado: más de 16.000 API de RapidAPI y cadenas de herramientas de varios pasos. Es menos canónico que BFCL, pero cubre una mayor variedad.

WebArena

Benchmark de código abierto para agentes de navegación web. Aloja 4 sitios web independientes (comercio electrónico, foro, portal para desarrolladores y GitLab); los agentes deben completar tareas realistas.

Running SWE-Bench Locally

git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .

# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
    --predictions_path my_agent_preds.json \
    --max_workers 4

Limitaciones de los benchmarks

  • Los benchmarks públicos se filtran a los datos de entrenamiento (riesgo de optimización específica)
  • Un único dominio: su tarea puede ser más difícil o más sencilla
  • «Resolver el X %» oculta qué X % se ha resuelto; la cola larga importa

Su propio benchmark es más importante

Los benchmarks públicos son útiles para comparar enfoques. Sin embargo, su propio conjunto de referencia con SUS datos es el único número que importa para SU producto.

Combinar evaluaciones internas y públicas

Una práctica saludable para el equipo:

  • Ejecute benchmarks públicos trimestralmente para seguir la capacidad de vanguardia
  • Ejecute evaluaciones internas en cada PR
  • Confíe en las cifras internas para tomar decisiones y en las públicas para conocer el panorama

Lectura de resultados de benchmarks

Cuando un artículo afirma «75 % en SWE-Bench»:

  • Compruebe QUÉ SWE-Bench se ha utilizado (Lite, Verified o completo)
  • Compruebe si se permitieron varios intentos
  • Compruebe si se utilizaron herramientas ocultas o pistas

Es fácil interpretar mal las cifras destacadas.

Evaluaciones internas frente a públicas

¿Qué es más importante para su producto?

Resumen

SWE-Bench para agentes de código, GAIA para asistentes generales, BFCL para uso de herramientas y WebArena para navegadores. Úselos para conocer el panorama; confíe en su propia evaluación para tomar decisiones.

Gratis para empezar

Aprende AI Agents con un tutor de IA — gratis

Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.

Cursos
60
Lecciones
239

Preguntas frecuentes

¿La lección «Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench» es gratis?

Sí — el texto completo de «Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.

¿Qué aprenderé en «Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench»?

Pruebas comparativas públicas para agentes de programación (SWE-Bench), asistentes generales (GAIA) y uso de herramientas (ToolBench). Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Agents?

No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.

¿Cuánto tiempo toma la lección «Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Agents?

Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Desarrollo de agentes guiado por evaluaciones
  2. Crear un conjunto de pruebas de referencia
  3. Problemas de los LLM como jueces
  4. Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench
← Volver a AI Agents