AI Agents · Lektion

Benchmark-Suites: SWE-Bench, GAIA, ToolBench

Öffentliche Benchmarks für Coding-Agents (SWE-Bench), allgemeine Assistenten (GAIA) und Tool-Nutzung (ToolBench).

Lektion 4 von 415 Schritte

Benchmark-Suites: SWE-Bench, GAIA, ToolBench ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.

Öffentliche Benchmarks

Für den Vergleich von Modellen und Frameworks über mehrere Teams hinweg sind öffentliche Benchmarks unverzichtbar. Sie decken gängige Fähigkeiten von Agenten ab:

  • SWE-Bench — Aufgaben der Softwareentwicklung
  • GAIA — Aufgaben für allgemeine Assistenten
  • ToolBench / BFCL — Tool-Nutzung
  • WebArena — Browser-Navigation

SWE-Bench

SWE-Bench prüft, ob ein Agent echte GitHub-Issues lösen kann:

  • 2294 echte Issues aus beliebten Python-Repositories
  • Der Agent muss einen Patch erzeugen, der alle versteckten Tests besteht
  • Die besten Frontier-Agenten lösen mittlerweile 50–70 % (2023 waren es weniger als 5 %)

SWE-Bench Verified

OpenAI hat eine Teilmenge mit 500 Issues und strengeren Qualitätsprüfungen veröffentlicht (SWE-Bench Verified). Dies ist der Branchenstandard.

GAIA

Benchmark für allgemeine KI-Assistenten (Meta + HF, 2023):

  • 466 Fragen auf drei Schwierigkeitsstufen
  • Erfordert Browsing, Codeausführung und multimodales Reasoning
  • So konzipiert, dass ein Mensch etwa 30 Sekunden benötigt; die besten Agenten erreichen etwa 60 %

Beispiel für eine GAIA-Frage

„Wie viele Studioalben von Mercedes Sosa wurden zwischen 1972 und 1985 veröffentlicht? Verwenden Sie die Liste auf ihrer englischen Wikipedia-Seite.“

Erfordert Browsing, das Lesen einer Tabelle und Zählen — typisch für mehrstufige Agentenaufgaben.

Berkeley Function Calling Leaderboard (BFCL)

Der Standard für die Evaluierung von Tool-Aufrufen:

  • Tausende (Anfrage, Tool-Definition, erwarteter Aufruf)-Tripel
  • Deckt einfache, parallele und Szenarien mit verpassten Tools ab
  • Wird vierteljährlich aktualisiert

ToolBench

Größer, aber unübersichtlicher: mehr als 16.000 APIs von RapidAPI, mehrstufige Tool-Ketten. Weniger maßgeblich als BFCL, aber breiter aufgestellt.

WebArena

Open-Source-Benchmark für Web-Browsing-Agenten. Beherbergt 4 eigenständige Websites (E-Commerce, Forum, Entwicklerportal, GitLab); Agenten müssen realistische Aufgaben erledigen.

Running SWE-Bench Locally

git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .

# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
    --predictions_path my_agent_preds.json \
    --max_workers 4

Einschränkungen von Benchmarks

  • Öffentliche Benchmarks gelangen in Trainingsdaten (Risiko des Benchmark-Gamings)
  • Einzelne Domäne — Ihre Aufgabe kann schwieriger oder einfacher sein
  • „X % lösen“ verschleiert, welche X % gemeint sind — die Long-Tail-Fälle sind wichtig

Ihr eigener Benchmark ist wichtiger

Öffentliche Benchmarks sind nützlich, um Ansätze zu vergleichen. Aber Ihr eigenes Gold-Set mit IHREN Daten ist die einzige Zahl, die für IHR Produkt zählt.

Interne und öffentliche Benchmarks kombinieren

Eine gute Praxis für Teams:

  • Führen Sie vierteljährlich öffentliche Benchmarks aus, um die Fähigkeiten auf dem neuesten Stand zu verfolgen
  • Führen Sie bei jedem PR interne Evaluierungen aus
  • Vertrauen Sie für Entscheidungen auf interne Zahlen und verwenden Sie öffentliche Zahlen, um den Markt zu beobachten

Benchmark-Ergebnisse lesen

Wenn in einem Paper „75 % auf SWE-Bench“ steht:

  • Prüfen Sie, WELCHES SWE-Bench gemeint ist (Lite, Verified, vollständig)
  • Prüfen Sie, ob mehrere Versuche erlaubt waren
  • Prüfen Sie, ob versteckte Tools oder Hinweise verwendet wurden

Schlagzeilenzahlen lassen sich leicht falsch interpretieren.

Interne vs. öffentliche Evaluierungen

Was ist für Ihr Produkt wichtiger?

Zusammenfassung

SWE-Bench für Code-Agenten, GAIA für allgemeine Assistenten, BFCL für Tool-Nutzung und WebArena für Browser. Verwenden Sie sie, um den Markt zu beobachten, und verlassen Sie sich für Entscheidungen auf Ihre eigene Evaluierung.

Kostenlos starten

Lerne AI Agents mit einem KI-Tutor — kostenlos

Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.

Kurse
60
Lektionen
239

Häufig gestellte Fragen

Ist die Lektion „Benchmark-Suites: SWE-Bench, GAIA, ToolBench“ kostenlos?

Ja — der vollständige Text von „Benchmark-Suites: SWE-Bench, GAIA, ToolBench“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Benchmark-Suites: SWE-Bench, GAIA, ToolBench“?

Öffentliche Benchmarks für Coding-Agents (SWE-Bench), allgemeine Assistenten (GAIA) und Tool-Nutzung (ToolBench). Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.

Wie lange dauert die Lektion „Benchmark-Suites: SWE-Bench, GAIA, ToolBench“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Eval-getriebene Entwicklung für Agents
  2. Einen Golden-Testdatensatz erstellen
  3. Fallstricke bei LLM-as-a-Judge
  4. Benchmark-Suites: SWE-Bench, GAIA, ToolBench
← Zurück zu AI Agents