0Pricing
AI Agents · Урок

Наборы сравнительных тестов: SWE-Bench, GAIA, ToolBench

Публичные наборы тестов для агентов программирования (SWE-Bench), универсальных ассистентов (GAIA) и использования инструментов (ToolBench).

«Наборы сравнительных тестов: SWE-Bench, GAIA, ToolBench» — бесплатный урок AI Agents на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.

Части этого урока еще не переведены и отображаются на английском.

Публичные сравнительные тесты

Для сравнения моделей и сред разработки между командами публичные сравнительные тесты незаменимы. Они охватывают распространённые возможности агентов:

  • SWE-Bench — задачи программной инженерии
  • GAIA — задачи универсального помощника
  • ToolBench / BFCL — использование инструментов
  • WebArena — навигация в браузере

SWE-Bench

SWE-Bench проверяет, способен ли агент решать реальные задачи GitHub:

  • 2294 реальные задачи из популярных репозиториев Python
  • Агент должен создать исправление, которое проходит все скрытые тесты
  • Лучшие передовые агенты теперь решают 50–70 % задач (в 2023 году было менее 5 %)

SWE-Bench Verified

OpenAI выпустила подмножество из 500 задач с более строгими проверками качества (SWE-Bench Verified). Это отраслевой стандарт.

GAIA

Сравнительный тест универсального ИИ-помощника (Meta + HF, 2023):

  • 466 вопросов трёх уровней сложности
  • Требует работы с браузером, выполнения кода и мультимодальных рассуждений
  • Спроектирован так, чтобы человеку требовалось около 30 секунд; лучшие агенты достигают примерно 60 %

Пример вопроса GAIA

«Сколько студийных альбомов Mercedes Sosa было выпущено между 1972 и 1985 годами? Используйте список с её англоязычной страницы в Wikipedia.»

Требуются работа с браузером, чтение таблицы и подсчёт — это типичный пример многошаговой задачи агента.

Таблица лидеров вызова функций Berkeley (BFCL)

Стандарт для оценки вызова инструментов:

  • Тысячи троек (запрос, описание инструмента, ожидаемый вызов)
  • Охватывает простые, параллельные сценарии и сценарии с пропущенным инструментом
  • Обновляется ежеквартально

ToolBench

Масштабнее, но менее аккуратно: более 16 тысяч API из RapidAPI, многошаговые цепочки инструментов. Менее каноничен, чем BFCL, зато охватывает больше областей.

WebArena

Сравнительный тест с открытым исходным кодом для агентов, работающих с веб-страницами. Он содержит 4 независимых сайта (электронная торговля, форум, портал разработчиков, GitLab); агенты должны выполнять реалистичные задачи.

Running SWE-Bench Locally

git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .

# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
    --predictions_path my_agent_preds.json \
    --max_workers 4

Ограничения сравнительных тестов

  • Публичные сравнительные тесты попадают в обучающие данные (риск подгонки под тест)
  • Одна предметная область — ваша задача может оказаться сложнее или проще
  • «Решает X %» скрывает, какие именно задачи входят в эти X %; задачи из длинного хвоста важны

Ваш собственный сравнительный тест важнее

Публичные сравнительные тесты полезны для сравнения подходов. Но только ваш золотой набор на ваших данных YOUR имеет значение для вашего продукта.

Сочетание внутренних и публичных тестов

Здоровая практика команды:

  • Запускайте публичные сравнительные тесты ежеквартально, чтобы отслеживать возможности передовых моделей
  • Запускайте внутренние оценки при каждом PR
  • Основывайте решения на внутренних показателях, а публичные используйте для изучения состояния отрасли

Как читать результаты сравнительных тестов

Когда в статье говорится «75 % в SWE-Bench»:

  • Проверьте, WHICH именно SWE-Bench используется (Lite, Verified или полный набор)
  • Проверьте, разрешены ли несколько попыток
  • Проверьте, использовали ли авторы скрытые инструменты или подсказки

Заявленные в заголовках показатели легко неправильно истолковать.

Внутренние и публичные оценки

Что важнее для вашего продукта?

Итоги

SWE-Bench — для агентов, работающих с кодом, GAIA — для универсальных помощников, BFCL — для использования инструментов, WebArena — для браузеров. Используйте их, чтобы изучать состояние отрасли, а для принятия решений доверяйте собственным оценкам.

Часто задаваемые вопросы

Урок «Наборы сравнительных тестов: SWE-Bench, GAIA, ToolBench» бесплатный?

Да — полный текст урока «Наборы сравнительных тестов: SWE-Bench, GAIA, ToolBench» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.

Чему я научусь в уроке «Наборы сравнительных тестов: SWE-Bench, GAIA, ToolBench»?

Публичные наборы тестов для агентов программирования (SWE-Bench), универсальных ассистентов (GAIA) и использования инструментов (ToolBench). Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Agents?

Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.

Сколько времени занимает урок «Наборы сравнительных тестов: SWE-Bench, GAIA, ToolBench»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Agents?

Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Разработка агентов на основе оценивания
  2. Создание эталонного набора тестов
  3. Недостатки оценки с помощью LLM-судьи
  4. Наборы сравнительных тестов: SWE-Bench, GAIA, ToolBench
← Назад к AI Agents