ベンチマークスイート:SWE-Bench、GAIA、ToolBench
コーディングエージェント(SWE-Bench)、汎用アシスタント(GAIA)、ツール利用(ToolBench)向けの公開ベンチマークを扱います。
「ベンチマークスイート:SWE-Bench、GAIA、ToolBench」はCoddyKit上の無料AI Agentsレッスンです。 これはレッスン4/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Agents学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Agentsコースには全4レッスンが含まれています。
このレッスンの一部はまだ翻訳されておらず、英語で表示されています。
公開ベンチマーク
チーム間でモデルやフレームワークを比較するには、公開ベンチマークが不可欠です。一般的なエージェントの能力を対象としています。
- SWE-Bench — ソフトウェアエンジニアリングのタスク
- GAIA — 汎用アシスタントのタスク
- ToolBench / BFCL — ツール利用
- WebArena — ブラウザー操作
SWE-Bench
SWE-Benchは、エージェントが実際のGitHub issueを解決できるかをテストします。
- 人気のPythonリポジトリから集めた2294件の実際のissue
- エージェントは、非公開テストをすべて通過するパッチを作成する必要がある
- 現在、最先端のエージェントは50〜70%を解決(2023年は5%未満)
SWE-Bench Verified
OpenAIは、より厳格な品質チェックを行う500件のサブセット(SWE-Bench Verified)を公開しました。これは業界標準です。
GAIA
General AI Assistantベンチマーク(Meta + HF、2023年):
- 3つの難易度にわたる466問
- ブラウジング、コード実行、マルチモーダル推論が必要
- 人間なら約30秒かかるよう設計されており、最先端のエージェントは約60%に到達
GAIAの問題例
「Mercedes Sosaのスタジオアルバムは、1972年から1985年の間に何枚発表されましたか。彼女の英語版Wikipediaページの一覧を使ってください。」
ブラウジング、表の読み取り、カウントが必要で、多段階エージェントのタスクとして典型的です。
Berkeley Function Calling Leaderboard(BFCL)
ツール呼び出し評価の標準です。
- 数千件の(クエリ、tool_def、期待される呼び出し)の組
- 単純なケース、並列実行、ツール呼び出し漏れのシナリオをカバー
- 四半期ごとに更新
ToolBench
より大規模ですが、整理が不十分です。RapidAPIの1万6000以上のAPIと、多段階のツールチェーンを対象としています。BFCLほど標準的ではありませんが、より広範囲をカバーします。
WebArena
Webブラウジングエージェント向けのオープンソースベンチマークです。4つの自己完結型Webサイト(EC、フォーラム、開発者ポータル、GitLab)をホストし、エージェントは現実的なタスクを完了する必要があります。
Running SWE-Bench Locally
git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .
# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
--predictions_path my_agent_preds.json \
--max_workers 4ベンチマークの限界
- 公開ベンチマークがトレーニングデータに含まれている(攻略されるリスク)
- 単一ドメインであるため、自分のタスクはより難しい場合も簡単な場合もある
- 「X%を解決」という数字では、そのX%が何を指すか分からない — ロングテールが重要
自分のベンチマークのほうが重要
公開ベンチマークはアプローチの比較には役立ちます。しかし、あなたの製品について意思決定する際に重要なのは、あなたのデータで作成した独自のゴールドセットの数値だけです。
内部評価と公開評価の組み合わせ
健全なチームの実践方法は次のとおりです。
- 最先端の性能を追跡するため、四半期ごとに公開ベンチマークを実行する
- すべてのPRで内部evalを実行する
- 意思決定では内部の数値を信頼し、公開の数値は業界動向の把握に使う
ベンチマーク結果の読み方
論文に「SWE-Benchで75%」と書かれていた場合:
- どのSWE-Benchかを確認する(Lite、Verified、full)
- 複数回の試行が許可されていたかを確認する
- 非公開のツールやヒントを使っていたかを確認する
見出しの数値は簡単に読み違えてしまいます。
内部evalと公開eval
あなたの製品にとって、どちらがより重要でしょうか。
まとめ
コードエージェントにはSWE-Bench、汎用アシスタントにはGAIA、ツール利用にはBFCL、ブラウザー操作にはWebArenaを使います。業界動向の把握にはこれらを使い、意思決定では独自のevalを信頼してください。
AI チューターと学ぶ AI Agents — 無料
ブラウザでリアルコードを書いて実行し、24/7 の AI チューターから瞬時にサポートを受け、ウェブまたはアプリで続きから学習できます。
- コース
- 60
- レッスン
- 239
よくある質問
「ベンチマークスイート:SWE-Bench、GAIA、ToolBench」レッスンは無料ですか?
はい。「ベンチマークスイート:SWE-Bench、GAIA、ToolBench」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Agentsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Agentsコースには全4レッスンが含まれています。
「ベンチマークスイート:SWE-Bench、GAIA、ToolBench」で何を学びますか?
コーディングエージェント(SWE-Bench)、汎用アシスタント(GAIA)、ツール利用(ToolBench)向けの公開ベンチマークを扱います。 ブラウザで直接実行するハンズオンコードでAI Agentsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。
AI Agentsを始めるのに経験は必要ですか?
事前経験は必要ありません。CoddyKitのAI Agentsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン4/4です。
「ベンチマークスイート:SWE-Bench、GAIA、ToolBench」レッスンにはどのくらい時間がかかりますか?
ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。
このAI Agentsレッスンでコードを書いて実行できますか?
はい。すべてのAI Agentsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。
このコースのすべてのレッスン
- エージェントのEval-Driven Development
- Golden Test Setの構築
- LLM-as-a-Judgeの落とし穴
- ベンチマークスイート:SWE-Bench、GAIA、ToolBench