AI Agents · レッスン

ベンチマークスイート:SWE-Bench、GAIA、ToolBench

コーディングエージェント(SWE-Bench)、汎用アシスタント(GAIA)、ツール利用(ToolBench)向けの公開ベンチマークを扱います。

レッスン 4/415 ステップ

「ベンチマークスイート:SWE-Bench、GAIA、ToolBench」はCoddyKit上の無料AI Agentsレッスンです。 これはレッスン4/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Agents学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Agentsコースには全4レッスンが含まれています。

このレッスンの一部はまだ翻訳されておらず、英語で表示されています。

公開ベンチマーク

チーム間でモデルやフレームワークを比較するには、公開ベンチマークが不可欠です。一般的なエージェントの能力を対象としています。

  • SWE-Bench — ソフトウェアエンジニアリングのタスク
  • GAIA — 汎用アシスタントのタスク
  • ToolBench / BFCL — ツール利用
  • WebArena — ブラウザー操作

SWE-Bench

SWE-Benchは、エージェントが実際のGitHub issueを解決できるかをテストします。

  • 人気のPythonリポジトリから集めた2294件の実際のissue
  • エージェントは、非公開テストをすべて通過するパッチを作成する必要がある
  • 現在、最先端のエージェントは50〜70%を解決(2023年は5%未満)

SWE-Bench Verified

OpenAIは、より厳格な品質チェックを行う500件のサブセット(SWE-Bench Verified)を公開しました。これは業界標準です。

GAIA

General AI Assistantベンチマーク(Meta + HF、2023年):

  • 3つの難易度にわたる466問
  • ブラウジング、コード実行、マルチモーダル推論が必要
  • 人間なら約30秒かかるよう設計されており、最先端のエージェントは約60%に到達

GAIAの問題例

「Mercedes Sosaのスタジオアルバムは、1972年から1985年の間に何枚発表されましたか。彼女の英語版Wikipediaページの一覧を使ってください。」

ブラウジング、表の読み取り、カウントが必要で、多段階エージェントのタスクとして典型的です。

Berkeley Function Calling Leaderboard(BFCL)

ツール呼び出し評価の標準です。

  • 数千件の(クエリ、tool_def、期待される呼び出し)の組
  • 単純なケース、並列実行、ツール呼び出し漏れのシナリオをカバー
  • 四半期ごとに更新

ToolBench

より大規模ですが、整理が不十分です。RapidAPIの1万6000以上のAPIと、多段階のツールチェーンを対象としています。BFCLほど標準的ではありませんが、より広範囲をカバーします。

WebArena

Webブラウジングエージェント向けのオープンソースベンチマークです。4つの自己完結型Webサイト(EC、フォーラム、開発者ポータル、GitLab)をホストし、エージェントは現実的なタスクを完了する必要があります。

Running SWE-Bench Locally

git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .

# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
    --predictions_path my_agent_preds.json \
    --max_workers 4

ベンチマークの限界

  • 公開ベンチマークがトレーニングデータに含まれている(攻略されるリスク)
  • 単一ドメインであるため、自分のタスクはより難しい場合も簡単な場合もある
  • 「X%を解決」という数字では、そのX%が何を指すか分からない — ロングテールが重要

自分のベンチマークのほうが重要

公開ベンチマークはアプローチの比較には役立ちます。しかし、あなたの製品について意思決定する際に重要なのは、あなたのデータで作成した独自のゴールドセットの数値だけです。

内部評価と公開評価の組み合わせ

健全なチームの実践方法は次のとおりです。

  • 最先端の性能を追跡するため、四半期ごとに公開ベンチマークを実行する
  • すべてのPRで内部evalを実行する
  • 意思決定では内部の数値を信頼し、公開の数値は業界動向の把握に使う

ベンチマーク結果の読み方

論文に「SWE-Benchで75%」と書かれていた場合:

  • どのSWE-Benchかを確認する(Lite、Verified、full)
  • 複数回の試行が許可されていたかを確認する
  • 非公開のツールやヒントを使っていたかを確認する

見出しの数値は簡単に読み違えてしまいます。

内部evalと公開eval

あなたの製品にとって、どちらがより重要でしょうか。

まとめ

コードエージェントにはSWE-Bench、汎用アシスタントにはGAIA、ツール利用にはBFCL、ブラウザー操作にはWebArenaを使います。業界動向の把握にはこれらを使い、意思決定では独自のevalを信頼してください。

無料で開始

AI チューターと学ぶ AI Agents — 無料

ブラウザでリアルコードを書いて実行し、24/7 の AI チューターから瞬時にサポートを受け、ウェブまたはアプリで続きから学習できます。

コース
60
レッスン
239

よくある質問

「ベンチマークスイート:SWE-Bench、GAIA、ToolBench」レッスンは無料ですか?

はい。「ベンチマークスイート:SWE-Bench、GAIA、ToolBench」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Agentsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Agentsコースには全4レッスンが含まれています。

「ベンチマークスイート:SWE-Bench、GAIA、ToolBench」で何を学びますか?

コーディングエージェント(SWE-Bench)、汎用アシスタント(GAIA)、ツール利用(ToolBench)向けの公開ベンチマークを扱います。 ブラウザで直接実行するハンズオンコードでAI Agentsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。

AI Agentsを始めるのに経験は必要ですか?

事前経験は必要ありません。CoddyKitのAI Agentsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン4/4です。

「ベンチマークスイート:SWE-Bench、GAIA、ToolBench」レッスンにはどのくらい時間がかかりますか?

ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。

このAI Agentsレッスンでコードを書いて実行できますか?

はい。すべてのAI Agentsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。

このコースのすべてのレッスン

  1. エージェントのEval-Driven Development
  2. Golden Test Setの構築
  3. LLM-as-a-Judgeの落とし穴
  4. ベンチマークスイート:SWE-Bench、GAIA、ToolBench
← AI Agentsに戻る