基准测试套件:SWE-Bench、GAIA、ToolBench
用于编程智能体(SWE-Bench)、通用助手(GAIA)和工具使用(ToolBench)的公开基准测试。
基准测试套件:SWE-Bench、GAIA、ToolBench 是 CoddyKit 上的免费 AI Agents 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。
本课时的部分内容尚未翻译,以英文显示。
公开基准
要跨团队比较模型和框架,公开基准必不可少。它们覆盖常见的智能体能力:
- SWE-Bench——软件工程任务
- GAIA——通用助手任务
- ToolBench / BFCL——工具使用
- WebArena——浏览器导航
SWE-Bench
SWE-Bench 测试智能体能否解决真实的 GitHub 问题:
- 来自热门 Python 代码库的 2294 个真实问题
- 智能体必须生成一个能够通过所有隐藏测试的补丁
- 目前顶尖的前沿智能体可以解决 50-70%(2023 年时低于 5%)
SWE-Bench Verified
OpenAI 发布了一个包含 500 个问题的子集,并采用了更严格的质量检查(SWE-Bench Verified)。这是行业标准。
GAIA
通用 AI 助手基准(Meta + HF,2023):
- 涵盖三个难度级别的 466 个问题
- 需要浏览、代码执行和多模态推理
- 设计目标是让人类在约 30 秒内完成;顶尖智能体的完成率约为 60%
GAIA 示例问题
“1972 年至 1985 年间,Mercedes Sosa 发布了多少张录音室专辑?请使用她的英文 Wikipedia 页面中的列表。”
这需要浏览、阅读表格和计数,是多步骤智能体任务的典型例子。
伯克利函数调用排行榜(BFCL)
工具调用评测的标准:
- 数千组三元组(查询、工具定义、预期调用)
- 覆盖简单、并行和遗漏工具等场景
- 每季度更新
ToolBench
规模更大但也更杂乱:来自 RapidAPI 的 1.6 万多个 API,以及多步骤工具链。其规范性不如 BFCL,但覆盖面更广。
WebArena
用于网页浏览智能体的开源基准。它托管 4 个自包含的网站(电子商务、论坛、开发者门户和 GitLab);智能体必须完成真实的任务。
Running SWE-Bench Locally
git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .
# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
--predictions_path my_agent_preds.json \
--max_workers 4基准的局限性
- 公开基准会泄漏到训练数据中(存在应试风险)
- 单一领域——您的任务可能更难或更容易
- “解决 X%”掩盖了具体是哪 X%——长尾部分很重要
您自己的基准更重要
公开基准对于比较不同方法很有用。但只有基于 YOUR 数据构建的黄金集,才是对 YOUR 产品真正重要的数字。
结合内部评测与公开评测
健康的团队实践:
- 每季度运行公开基准,以跟踪前沿能力
- 每个 PR 都运行内部评测
- 使用内部数据做决策;使用公开数据了解领域情况
解读基准结果
当论文声称“SWE-Bench 上达到 75%”时:
- 检查是 WHICH SWE-Bench(Lite、Verified 还是完整版本)
- 检查是否允许多次尝试
- 检查是否使用了隐藏工具或提示
标题中的数字很容易被误读。
内部评测与公开评测
对于您的产品,哪一种更重要?
回顾
代码智能体使用 SWE-Bench,通用助手使用 GAIA,工具使用使用 BFCL,浏览器智能体使用 WebArena。使用它们来了解领域情况;做决策时信任您自己的评测。
常见问题解答
「基准测试套件:SWE-Bench、GAIA、ToolBench」课时是免费的吗?
是的 — 「基准测试套件:SWE-Bench、GAIA、ToolBench」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。
「基准测试套件:SWE-Bench、GAIA、ToolBench」这节课中我会学到什么?
用于编程智能体(SWE-Bench)、通用助手(GAIA)和工具使用(ToolBench)的公开基准测试。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 AI Agents 需要有经验吗?
无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。
「基准测试套件:SWE-Bench、GAIA、ToolBench」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 AI Agents 课中编写并运行代码吗?
能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 面向评估的智能体开发
- 构建黄金测试集
- LLM 作为评判者的陷阱
- 基准测试套件:SWE-Bench、GAIA、ToolBench