0Pricing
AI Agents · Lekcja

Zestawy benchmarków: SWE-Bench, GAIA, ToolBench

Publiczne benchmarki dla agentów programistycznych (SWE-Bench), ogólnych asystentów (GAIA) i używania narzędzi (ToolBench).

Zestawy benchmarków: SWE-Bench, GAIA, ToolBench to bezpłatna lekcja AI Agents na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Agents, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Agents zawiera 4 lekcji w sumie.

Części tej lekcji nie zostały jeszcze przetłumaczone i są wyświetlane po angielsku.

Publiczne benchmarki

Do porównywania modeli i frameworków między zespołami niezbędne są publiczne benchmarki. Obejmują typowe możliwości agentów:

  • SWE-Bench — zadania z zakresu inżynierii oprogramowania
  • GAIA — zadania dla ogólnych asystentów
  • ToolBench / BFCL — korzystanie z narzędzi
  • WebArena — nawigacja w przeglądarce

SWE-Bench

SWE-Bench sprawdza, czy agent potrafi rozwiązywać rzeczywiste problemy z GitHuba:

  • 2294 rzeczywiste problemy z popularnych repozytoriów Pythona
  • Agent musi przygotować patch przechodzący wszystkie ukryte testy
  • Najlepsze obecnie agenty rozwiązują 50–70% problemów (w 2023 r. było to mniej niż 5%)

SWE-Bench Verified

OpenAI opublikowało podzbiór obejmujący 500 problemów i poddany bardziej rygorystycznym kontrolom jakości (SWE-Bench Verified). Jest to standard branżowy.

GAIA

Benchmark ogólnego asystenta AI (Meta + HF, 2023):

  • 466 pytań na trzech poziomach trudności
  • Wymaga przeglądania sieci, wykonywania kodu i wnioskowania multimodalnego
  • Zaprojektowany tak, aby człowiek potrzebował około 30 sekund; najlepsze agenty osiągają około 60%

Przykładowe pytanie GAIA

„Ile albumów studyjnych Mercedes Sosa wydano w latach 1972–1985? Należy skorzystać z listy na jej anglojęzycznej stronie Wikipedii.”

Wymaga przeglądania sieci, odczytania tabeli i liczenia — jest typowe dla wieloetapowych zadań agentów.

Berkeley Function Calling Leaderboard (BFCL)

Standard oceny wywoływania narzędzi:

  • Tysiące trójek (zapytanie, definicja narzędzia, oczekiwane wywołanie)
  • Obejmuje scenariusze proste, równoległe i z pominięciem narzędzia
  • Aktualizowany co kwartał

ToolBench

Większy, ale mniej uporządkowany: ponad 16 tys. interfejsów API z RapidAPI i wieloetapowe łańcuchy narzędzi. Mniej kanoniczny niż BFCL, ale obejmuje szerszy zakres.

WebArena

Benchmark open source dla agentów przeglądających sieć. Udostępnia 4 samodzielne strony internetowe (handel elektroniczny, forum, portal deweloperski, GitLab); agenty muszą wykonywać realistyczne zadania.

Running SWE-Bench Locally

git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .

# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
    --predictions_path my_agent_preds.json \
    --max_workers 4

Ograniczenia benchmarków

  • Publiczne benchmarki przedostają się do danych treningowych (ryzyko grania pod benchmark)
  • Jedna domena — własne zadanie może być trudniejsze lub łatwiejsze
  • „Rozwiązuje X%” ukrywa, które X% — problemy z długiego ogona mają znaczenie

Własny benchmark jest ważniejszy

Publiczne benchmarki są przydatne do porównywania podejść. Jednak własny zestaw referencyjny na WŁASNYCH danych jest jedyną liczbą, która ma znaczenie dla WŁASNEGO produktu.

Łączenie ewaluacji wewnętrznych i publicznych

Dobra praktyka zespołowa:

  • Uruchamiać publiczne benchmarki co kwartał, aby śledzić możliwości czołowych modeli
  • Uruchamiać wewnętrzne ewaluacje przy każdym PR
  • Ufać wewnętrznym liczbom przy podejmowaniu decyzji, a publicznym — do śledzenia sytuacji w branży

Interpretowanie wyników benchmarku

Gdy w artykule napisano „75% w SWE-Bench”:

  • Należy sprawdzić, o który SWE-Bench chodzi (Lite, Verified czy pełny)
  • Należy sprawdzić, czy dozwolone były wielokrotne próby
  • Należy sprawdzić, czy użyto ukrytych narzędzi lub podpowiedzi

Łatwo błędnie zinterpretować liczby podawane w nagłówkach.

Ewaluacje wewnętrzne a publiczne

Co ma większe znaczenie dla Państwa produktu?

Podsumowanie

SWE-Bench służy do oceny agentów kodujących, GAIA — ogólnych asystentów, BFCL — korzystania z narzędzi, a WebArena — przeglądarek. Należy używać ich do śledzenia sytuacji w branży, ale przy podejmowaniu decyzji ufać własnej ewaluacji.

Często zadawane pytania

Czy lekcja „Zestawy benchmarków: SWE-Bench, GAIA, ToolBench” jest bezpłatna?

Tak — pełny tekst „Zestawy benchmarków: SWE-Bench, GAIA, ToolBench” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Agents, przejdź na CoddyKit PRO. Kurs AI Agents zawiera 4 lekcji w sumie.

Co nauczysz się w „Zestawy benchmarków: SWE-Bench, GAIA, ToolBench”?

Publiczne benchmarki dla agentów programistycznych (SWE-Bench), ogólnych asystentów (GAIA) i używania narzędzi (ToolBench). Ćwiczysz AI Agents z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć AI Agents?

Nie wymagamy żadnego doświadczenia. AI Agents w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.

Ile czasu zajmuje lekcja „Zestawy benchmarków: SWE-Bench, GAIA, ToolBench”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji AI Agents?

Tak. Każda lekcja AI Agents zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Tworzenie agentów sterowane ewaluacją
  2. Budowanie zestawu testów referencyjnych
  3. Pułapki podejścia LLM-as-a-Judge
  4. Zestawy benchmarków: SWE-Bench, GAIA, ToolBench
← Powrót do AI Agents