Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench
Pruebas comparativas públicas para agentes de programación (SWE-Bench), asistentes generales (GAIA) y uso de herramientas (ToolBench).
Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.
Partes de esta lección aún no han sido traducidas y se muestran en inglés.
Benchmarks públicos
Para comparar modelos y frameworks entre equipos, los benchmarks públicos son esenciales. Cubren capacidades habituales de los agentes:
- SWE-Bench — tareas de ingeniería de software
- GAIA — tareas de asistentes generales
- ToolBench / BFCL — uso de herramientas
- WebArena — navegación en el navegador
SWE-Bench
SWE-Bench comprueba si un agente puede resolver incidencias reales de GitHub:
- 2294 incidencias reales de repositorios populares de Python
- El agente debe producir un parche que supere todas las pruebas ocultas
- Los agentes de vanguardia más avanzados ya resuelven entre el 50 % y el 70 % (frente a menos del 5 % en 2023)
SWE-Bench Verified
OpenAI publicó un subconjunto de 500 incidencias con controles de calidad más estrictos (SWE-Bench Verified). Es el estándar del sector.
GAIA
Benchmark de asistentes de IA general (Meta + HF, 2023):
- 466 preguntas repartidas en tres niveles de dificultad
- Requiere navegación web, ejecución de código y razonamiento multimodal
- Está diseñado para que una persona tarde unos 30 segundos; los agentes más avanzados alcanzan aproximadamente el 60 %
Ejemplo de pregunta de GAIA
«¿Cuántos álbumes de estudio de Mercedes Sosa se publicaron entre 1972 y 1985? Use la lista de su página de Wikipedia en inglés».
Requiere navegar por la web, leer una tabla y contar, capacidades típicas de las tareas de agentes de varios pasos.
Berkeley Function Calling Leaderboard (BFCL)
El estándar para evaluar llamadas a herramientas:
- Miles de ternas (consulta, definición de herramienta, llamada esperada)
- Cubre escenarios sencillos, paralelos y de omisión de herramientas
- Se actualiza trimestralmente
ToolBench
Es más grande, pero también más desordenado: más de 16.000 API de RapidAPI y cadenas de herramientas de varios pasos. Es menos canónico que BFCL, pero cubre una mayor variedad.
WebArena
Benchmark de código abierto para agentes de navegación web. Aloja 4 sitios web independientes (comercio electrónico, foro, portal para desarrolladores y GitLab); los agentes deben completar tareas realistas.
Running SWE-Bench Locally
git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .
# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
--predictions_path my_agent_preds.json \
--max_workers 4Limitaciones de los benchmarks
- Los benchmarks públicos se filtran a los datos de entrenamiento (riesgo de optimización específica)
- Un único dominio: su tarea puede ser más difícil o más sencilla
- «Resolver el X %» oculta qué X % se ha resuelto; la cola larga importa
Su propio benchmark es más importante
Los benchmarks públicos son útiles para comparar enfoques. Sin embargo, su propio conjunto de referencia con SUS datos es el único número que importa para SU producto.
Combinar evaluaciones internas y públicas
Una práctica saludable para el equipo:
- Ejecute benchmarks públicos trimestralmente para seguir la capacidad de vanguardia
- Ejecute evaluaciones internas en cada PR
- Confíe en las cifras internas para tomar decisiones y en las públicas para conocer el panorama
Lectura de resultados de benchmarks
Cuando un artículo afirma «75 % en SWE-Bench»:
- Compruebe QUÉ SWE-Bench se ha utilizado (Lite, Verified o completo)
- Compruebe si se permitieron varios intentos
- Compruebe si se utilizaron herramientas ocultas o pistas
Es fácil interpretar mal las cifras destacadas.
Evaluaciones internas frente a públicas
¿Qué es más importante para su producto?
Resumen
SWE-Bench para agentes de código, GAIA para asistentes generales, BFCL para uso de herramientas y WebArena para navegadores. Úselos para conocer el panorama; confíe en su propia evaluación para tomar decisiones.
Aprende AI Agents con un tutor de IA — gratis
Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.
- Cursos
- 60
- Lecciones
- 239
Preguntas frecuentes
¿La lección «Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench» es gratis?
Sí — el texto completo de «Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.
¿Qué aprenderé en «Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench»?
Pruebas comparativas públicas para agentes de programación (SWE-Bench), asistentes generales (GAIA) y uso de herramientas (ToolBench). Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar AI Agents?
No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.
¿Cuánto tiempo toma la lección «Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de AI Agents?
Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Desarrollo de agentes guiado por evaluaciones
- Crear un conjunto de pruebas de referencia
- Problemas de los LLM como jueces
- Conjuntos de pruebas comparativas: SWE-Bench, GAIA y ToolBench