0Pricing
AI Agents · Lezione

Sviluppo degli agenti guidato dalle valutazioni

Scriva la valutazione prima di distribuire l'agente: è l'unico modo per iterare senza introdurre regressioni.

Sviluppo degli agenti guidato dalle valutazioni è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 1 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.

Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.

Gli eval sono test per l'IA

Non distribuirebbe codice senza test. La stessa logica si applica agli agenti LLM: senza eval, ogni modifica è un lancio della monetina.

Eval-Driven Development (EDD) significa scrivere l'eval PRIMA di distribuire la modifica.

Il ciclo EDD

  1. Scriva un eval che fallisce: input + comportamento atteso
  2. Migliori l'agente finché l'eval non passa
  3. Aggiunga l'eval alla suite
  4. Esegua la suite a ogni modifica

Che cosa valutare

Per un agente, esegua gli eval a più livelli:

  • Componente — il retriever restituisce i chunk corretti?
  • Fase — l'LLM sceglie lo strumento corretto?
  • End-to-end — l'agente produce la risposta finale corretta?

Dati per gli eval

Ogni riga dell'eval contiene almeno:

eval_example = {
    'input': 'What is our return policy?',
    'expected_output': 'mentions 30-day window',
    'expected_tool_calls': ['retrieve'],
    'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
    print(f"{k}: {v}")

Run an Eval Suite

def run_evals(suite, agent):
    results = []
    for case in suite:
        actual = agent.run(case['input'])
        scores = [
            score_correctness(actual, case['expected_output']),
            score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
        ]
        results.append({'case': case, 'actual': actual, 'scores': scores})
    return results

Integrazione con la CI

Esegua gli eval a ogni PR. Se la qualità scende al di sotto della soglia, blocchi il merge:

# .github/workflows/evals.yml
on: pull_request
jobs:
  evals:
    runs-on: ubuntu-latest
    steps:
      - run: python -m evals.run --fail-below 0.85

Frequenza degli eval

  • Eval dei componenti — a ogni PR
  • Eval end-to-end — a ogni PR (su un campione) + ogni notte (completo)
  • Trace di produzione -> set di eval — ogni settimana

Pipeline da produzione a eval

Analizzi le trace reali. Gli esiti negativi diventano gli eval di domani:

for trace in production_traces_with_thumbs_down():
    add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)

Eval con LangSmith / Langfuse

Entrambi gli strumenti offrono il supporto integrato agli eval: versionamento dei dataset, funzioni di eval e viste di confronto.

Controlli manuali a campione

Gli eval automatizzati non colgono lo stile e le sfumature. Periodicamente legga a mano 20 trace casuali: in questo modo individuerà problemi che gli eval non rilevano.

Anti-pattern: memorizzazione del set di eval

Se ottimizza l'agente finché supera il proprio eval, ma l'eval è piccolo, rischia l'overfitting. Continui ad ampliare gli eval e alterni le suddivisioni tra test e training.

Manutenzione del set di eval

Gli eval cambiano con l'evoluzione del prodotto. Aggiunga casi per le nuove funzionalità e ritiri quelli relativi alle funzionalità rimosse.

Definizione di EDD

Che cosa significa Eval-Driven Development?

Riepilogo

Eval-Driven Development è irrinunciabile per gli agenti seri. Scriva eval a ogni livello, li esegua nella CI e ampli la suite usando le trace di produzione.

Domande Frequenti

La lezione «Sviluppo degli agenti guidato dalle valutazioni» è gratuita?

Sì — il testo completo di «Sviluppo degli agenti guidato dalle valutazioni» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.

Cosa imparerò in «Sviluppo degli agenti guidato dalle valutazioni»?

Scriva la valutazione prima di distribuire l'agente: è l'unico modo per iterare senza introdurre regressioni. Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Agents?

Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 1 di 4.

Quanto tempo richiede la lezione «Sviluppo degli agenti guidato dalle valutazioni»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Agents?

Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Sviluppo degli agenti guidato dalle valutazioni
  2. Creare un set di test di riferimento
  3. Problemi degli LLM-as-a-Judge
  4. Suite di benchmark: SWE-Bench, GAIA, ToolBench
← Torna a AI Agents