0Pricing
AI Agents · Lezione

Suite di benchmark: SWE-Bench, GAIA, ToolBench

Benchmark pubblici per agenti di coding (SWE-Bench), assistenti generalisti (GAIA) e uso degli strumenti (ToolBench).

Suite di benchmark: SWE-Bench, GAIA, ToolBench è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.

Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.

Benchmark pubblici

Per confrontare modelli e framework tra team, i benchmark pubblici sono essenziali. Coprono capacità comuni degli agenti:

  • SWE-Bench — attività di ingegneria del software
  • GAIA — attività da assistente generalista
  • ToolBench / BFCL — utilizzo degli strumenti
  • WebArena — navigazione nel browser

SWE-Bench

SWE-Bench verifica se un agente è in grado di risolvere problemi reali su GitHub:

  • 2294 problemi reali provenienti da popolari repository Python
  • L'agente deve produrre una patch che superi tutti i test nascosti
  • I migliori agenti all'avanguardia ora ne risolvono il 50-70% (meno del 5% nel 2023)

SWE-Bench Verified

OpenAI ha rilasciato un sottoinsieme di 500 problemi con controlli di qualità più rigorosi (SWE-Bench Verified). È lo standard del settore.

GAIA

Benchmark per assistenti IA generalisti (Meta + HF, 2023):

  • 466 domande distribuite su tre livelli di difficoltà
  • Richiede navigazione web, esecuzione del codice e ragionamento multimodale
  • Progettato in modo che a una persona occorrano circa 30 secondi; i migliori agenti raggiungono circa il 60%

Esempio di domanda GAIA

"Quanti album in studio di Mercedes Sosa sono stati pubblicati tra il 1972 e il 1985? Utilizzi l'elenco della sua pagina di Wikipedia in inglese."

Richiede navigazione web, lettura di una tabella e conteggio: attività tipiche degli agenti a più fasi.

Berkeley Function Calling Leaderboard (BFCL)

Lo standard per la valutazione delle chiamate agli strumenti:

  • Migliaia di triple (query, tool_def, chiamata attesa)
  • Copre scenari semplici, paralleli e con strumento omesso
  • Aggiornato ogni trimestre

ToolBench

Più ampio, ma meno ordinato: oltre 16.000 API da RapidAPI e catene di strumenti a più fasi. Meno canonico di BFCL, ma con una copertura più estesa.

WebArena

Benchmark open source per agenti di navigazione web. Ospita 4 siti web autonomi (e-commerce, forum, portale per sviluppatori, GitLab); gli agenti devono completare attività realistiche.

Running SWE-Bench Locally

git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .

# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
    --predictions_path my_agent_preds.json \
    --max_workers 4

Limiti dei benchmark

  • I benchmark pubblici finiscono nei dati di training (rischio di ottimizzazione opportunistica)
  • Dominio unico: la propria attività potrebbe essere più difficile o più facile
  • "Risoluzione del X%" nasconde quale sia quel X%: la coda lunga è importante

Il proprio benchmark è più importante

I benchmark pubblici sono utili per confrontare gli approcci. Tuttavia, il proprio gold set sui PROPRI dati è l'unico numero che conta per il PROPRIO prodotto.

Combinare dati interni e pubblici

Una buona pratica per il team:

  • Esegua benchmark pubblici ogni trimestre per monitorare le capacità all'avanguardia
  • Esegua gli eval interni a ogni PR
  • Si affidi ai numeri interni per le decisioni e a quelli pubblici per seguire l'evoluzione del settore

Interpretazione dei risultati del benchmark

Quando un articolo afferma "75% su SWE-Bench":

  • Controlli QUALE SWE-Bench (Lite, Verified o completo)
  • Controlli se erano consentiti più tentativi
  • Controlli se sono stati usati strumenti o suggerimenti nascosti

È facile interpretare male i numeri in evidenza.

Eval interni e pubblici

Quali sono più importanti per il proprio prodotto?

Riepilogo

SWE-Bench per gli agenti di codice, GAIA per gli assistenti generalisti, BFCL per l'utilizzo degli strumenti e WebArena per i browser. Li utilizzi per seguire l'evoluzione del settore, ma si affidi al proprio eval per le decisioni.

Domande Frequenti

La lezione «Suite di benchmark: SWE-Bench, GAIA, ToolBench» è gratuita?

Sì — il testo completo di «Suite di benchmark: SWE-Bench, GAIA, ToolBench» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.

Cosa imparerò in «Suite di benchmark: SWE-Bench, GAIA, ToolBench»?

Benchmark pubblici per agenti di coding (SWE-Bench), assistenti generalisti (GAIA) e uso degli strumenti (ToolBench). Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Agents?

Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.

Quanto tempo richiede la lezione «Suite di benchmark: SWE-Bench, GAIA, ToolBench»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Agents?

Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Sviluppo degli agenti guidato dalle valutazioni
  2. Creare un set di test di riferimento
  3. Problemi degli LLM-as-a-Judge
  4. Suite di benchmark: SWE-Bench, GAIA, ToolBench
← Torna a AI Agents