0Pricing
AI Agents · Lezione

Valutare i modelli ottimizzati rispetto al modello base

Confronti il modello base e quello ottimizzato sul suo eval set con un test A/B: a volte il fine-tuning danneggia più di quanto aiuti

Valutare i modelli ottimizzati rispetto al modello base è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.

Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.

Non si fidi della loss di addestramento

Una loss di addestramento bassa non significa che il modello sarà migliore in produzione. Il modello potrebbe andare in overfitting, perdere capacità generali o peggiorare le prestazioni in attività non viste.

Valuti sempre il modello sottoposto a fine-tuning su un set di valutazione separato.

Le tre suddivisioni indispensabili per la valutazione

  1. Train — utilizzato nel fine-tuning
  2. Validation — utilizzato per scegliere il checkpoint migliore
  3. Test — mai utilizzato durante l'addestramento; SOLO per la valutazione finale

A/B Against Base

results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')

Attenzione al catastrophic forgetting

Il fine-tuning su dati ristretti può peggiorare le prestazioni del modello in ALTRE attività. Esegua i test anche su un set di valutazione ampio, non solo sulla nuova specializzazione.

Report per categoria

Applichi dei tag al set di valutazione e riporti i punteggi per categoria:

Category 'extraction': base 0.78 -> tuned 0.91  (+0.13)
Category 'reasoning':  base 0.85 -> tuned 0.78  (-0.07)   <-- regression
Category 'chat':       base 0.82 -> tuned 0.83  (+0.01)

Calibrazione

I modelli sottoposti a fine-tuning diventano spesso troppo sicuri di sé. Confronti la probabilità prevista con la probabilità effettiva di correttezza e, se necessario, esegua la calibrazione.

Deriva nella lunghezza e nello stile

I modelli sottoposti a fine-tuning tendono verso la distribuzione dei dati di addestramento. Se i dati di addestramento sono più brevi, anche gli output diventano più brevi. A volte è desiderabile, a volte no.

Test A/B nel mondo reale

Oltre alle valutazioni offline, esegua un test A/B in produzione:

if user.bucket == 'tuned':
    response = tuned_model.run(...)
else:
    response = base_model.run(...)

log_metric('thumbs_up', response.feedback)

Confronto tra qualità e costi

Il modello sottoposto a fine-tuning potrebbe essere più piccolo ed economico. Costo-qualità complessivi:

  • Base GPT-4o: $X per chiamata, qualità Y
  • Llama 8B sottoposto a fine-tuning (self-hosted): $X/10 per chiamata, qualità 0.9Y
  • Probabilmente è il vincitore se Y rimane sufficientemente alta

Modalità di errore nascoste

Provi input avversari:

  • Prompt che tentano di aggirare le protezioni
  • Input fuori distribuzione
  • Prompt per casi limite

A volte il fine-tuning indebolisce la sicurezza: verifichi il risultato prima del rilascio.

Avvertenza sull'LLM-as-Judge

Se utilizza un LLM come valutatore, scelga una famiglia di modelli DIVERSA da quella del modello sottoposto a fine-tuning. In caso contrario, il valutatore assegnerà punteggi elevati in modo distorto.

Quando iterare sul dataset

Se la valutazione mostra regressioni in categorie specifiche:

  1. Trovi esempi simili nelle tracce di produzione
  2. Li aggiunga al set di addestramento
  3. Esegua nuovamente l'addestramento
  4. Ripeta la valutazione

Va bene tornare indietro

Se il fine-tuning offre prestazioni inferiori, lo scarti e riprovi. I costi irrecuperabili non sono un motivo per rilasciare un modello peggiore.

Catastrophic forgetting

Che cos'è il catastrophic forgetting nel fine-tuning?

Riepilogo

Valuti il modello sottoposto a fine-tuning rispetto al modello di base sul PROPRIO set di riferimento. Controlli le regressioni per categoria. Esegua test A/B in produzione. Torni indietro se il modello peggiora; iteri sul dataset se i risultati sono positivi solo in parte.

Domande Frequenti

La lezione «Valutare i modelli ottimizzati rispetto al modello base» è gratuita?

Sì — il testo completo di «Valutare i modelli ottimizzati rispetto al modello base» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.

Cosa imparerò in «Valutare i modelli ottimizzati rispetto al modello base»?

Confronti il modello base e quello ottimizzato sul suo eval set con un test A/B: a volte il fine-tuning danneggia più di quanto aiuti Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Agents?

Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.

Quanto tempo richiede la lezione «Valutare i modelli ottimizzati rispetto al modello base»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Agents?

Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Quando il fine-tuning è migliore del prompting
  2. Raccolta dei dati: traiettorie e riproduzione dei trace
  3. LoRA e QLoRA per un tuning conveniente
  4. Valutare i modelli ottimizzati rispetto al modello base
← Torna a AI Agents