Leggere e valutare gli output dell'IA
Criteri per valutare rilevanza, accuratezza e completezza delle risposte dell'IA
Leggere e valutare gli output dell'IA è una lezione AI Prompt Engineering gratuita su CoddyKit. Questa è la lezione 1 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Prompt Engineering, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Prompt Engineering include 4 lezioni in totale.
Perché la valutazione è importante
Ottenere una risposta dall'IA è solo metà del lavoro. La seconda metà consiste nel valutare se quella risposta è davvero valida.
Senza un framework di valutazione chiaro, potrebbe accettare una risposta dall'aspetto curato ma che risponde alla domanda sbagliata, oppure rifiutare una risposta realmente utile perché non è formattata nel modo previsto.
Sviluppare un occhio affidabile per la qualità degli output dell'IA è una delle competenze più pratiche nel prompt engineering.
I quattro criteri di valutazione
Quando legge una risposta dell'IA, la valuti in base a quattro dimensioni:
- Rilevanza — Ha risposto alla domanda effettiva che ha posto?
- Accuratezza — Le informazioni sono corrette nei fatti?
- Completezza — Ha trattato tutte le parti della richiesta?
- Formato — È strutturata nel modo di cui ha bisogno?
Una risposta può ottenere un punteggio elevato in tre dimensioni e fallire nella quarta. Ogni criterio è importante indipendentemente dagli altri.
Criterio 1: Rilevanza
La rilevanza si chiede: il modello ha risposto alla domanda che Lei ha effettivamente posto, oppure ha risposto a una domanda diversa, seppur correlata?
Esempio: Lei chiede "Quali sono i rischi dell'uso degli LLM nel settore sanitario?" e il modello risponde con una panoramica generale sul funzionamento degli LLM. La risposta può essere accurata, ma non è pertinente: ha mancato il punto.
Per verificare la rilevanza, rilegga il prompt originale e si chieda: la risposta affronta direttamente ciò che ho chiesto?
Criterio 2: Accuratezza
L'accuratezza si chiede: i fatti, i dati e le affermazioni contenuti nella risposta sono corretti?
I modelli di IA possono avere allucinazioni: potrebbero affermare con sicurezza cose semplicemente errate. I problemi di accuratezza più comuni includono:
- Statistiche o date errate
- Citazioni attribuite alla persona sbagliata
- Informazioni obsolete presentate come attuali
- Riferimenti o citazioni inventati
Per gli argomenti fattuali, verifichi sempre le affermazioni importanti tramite una fonte affidabile prima di utilizzare l'output.
Criterio 3: Completezza
La completezza si chiede: la risposta ha coperto tutte le parti della richiesta?
Se il prompt conteneva più parti — "Spieghi X, elenchi tre esempi e suggerisca il prossimo passo" — verifichi che il modello le abbia affrontate tutte e tre, non solo la prima.
A volte i modelli tralasciano l'ultima parte di una richiesta composta da più elementi, soprattutto quando il prompt è lungo. Confrontare punto per punto la risposta con il prompt è il modo più affidabile per verificarne la completezza.
Criterio 4: Formato
Il formato si chiede: la risposta è strutturata nel modo di cui Lei ha bisogno?
Anche una risposta perfettamente accurata e completa può essere difficile da utilizzare se il formato non è corretto. Ecco alcuni errori comuni di formattazione:
- Testo discorsivo quando serviva un elenco puntato
- Un lungo saggio quando serviva un riepilogo
- Intestazioni mancanti che avrebbero facilitato la navigazione
- Codice senza spiegazioni o spiegazioni senza codice
I problemi di formato sono spesso i più facili da correggere con un prompt di follow-up.
Una semplice checklist di valutazione
Dopo aver ricevuto una risposta dell'IA, segua mentalmente questa checklist:
- Rilevanza: risponde alla mia domanda effettiva?
- Accuratezza: posso fidarmi dei fatti? Che cosa dovrei verificare?
- Completezza: ha coperto tutte le parti della mia richiesta?
- Formato: è strutturata in un modo che posso utilizzare?
Se un criterio non viene soddisfatto, questo indica esattamente quale tipo di prompt di follow-up scrivere. Ogni criterio corrisponde a uno specifico tipo di correzione.
Valutare nel codice: assegnare un punteggio a una risposta
Può creare un wrapper leggero di valutazione in Python che assegni un punteggio a una risposta per ciascun criterio, utilizzando una seconda chiamata a un LLM:
import openai
client = openai.OpenAI(api_key='sk-...')
def evaluate_response(original_prompt, response_text):
eval_prompt = f'''You are an evaluator. Score the following AI response on a scale of 1-5 for each criterion.
Original prompt: {original_prompt}
AI response: {response_text}
Score each:
- Relevance (1-5): Did it answer the actual question?
- Accuracy (1-5): Are the facts correct? (flag any concerns)
- Completeness (1-5): Did it cover all parts of the request?
- Format (1-5): Is it structured appropriately?
Return your scores as: Relevance: X, Accuracy: X, Completeness: X, Format: X
Then a one-sentence note for any score below 4.'''
result = client.chat.completions.create(
model='gpt-4o-mini',
messages=[{'role': 'user', 'content': eval_prompt}]
)
return result.choices[0].message.contentErrori di rilevanza: schemi comuni
Gli errori di rilevanza tendono a seguire schemi prevedibili. Riconoscerli rende più rapida la valutazione:
- Deriva del tema — Il modello inizia correttamente, poi devia verso un argomento correlato
- Sostituzione della domanda — Il modello risponde a una versione più semplice o più facile della domanda
- Generalizzazione eccessiva — Lei ha chiesto informazioni su un caso specifico, ma il modello risponde al caso generale
- Ignorare il vincolo — Lei ha specificato un contesto, ad esempio "per principianti", ma il modello lo ha ignorato
Ogni schema suggerisce una correzione specifica da inserire nel prompt di follow-up.
Segnali d'allarme sull'accuratezza da tenere d'occhio
Anche quando non può verificare immediatamente un'affermazione, alcuni segnali suggeriscono una minore accuratezza:
- Numeri molto specifici citati senza una fonte
- Affermazioni che sembrano fin troppo comode o perfettamente pertinenti
- Riferimenti a studi, articoli o libri indicati tramite titolo e autore
- Date e numeri di versione, che cambiano frequentemente
- Dettagli specifici di carattere legale, medico o finanziario
Questi elementi non dimostrano che ci sia un errore, ma sono quelli che vale la pena verificare attentamente prima di utilizzare l'output in un contesto ad alto rischio.
Usare la valutazione per scrivere follow-up migliori
Il vero valore della valutazione sta nel fatto che ogni criterio non soddisfatto corrisponde direttamente a un tipo di prompt di follow-up:
- Rilevanza insufficiente → "Ha risposto a X, ma la mia domanda riguardava Y. Si concentri su Y."
- Dubbi sull'accuratezza → "Verifichi nuovamente l'affermazione relativa a Z e indichi su quale base si fonda."
- Completezza insufficiente → "Non ha affrontato la terza parte della mia domanda. La aggiunga, per favore."
- Formato errato → "Riscriva il testo sotto forma di elenco puntato, con un riepilogo di una riga in cima."
La valutazione e la scrittura di prompt di follow-up funzionano come un ciclo di feedback.
Verifica delle conoscenze: criteri di valutazione
Lei chiede al modello: "Elenchi i 5 principali framework web Python, con una descrizione di una frase per ciascuno." Il modello risponde con un saggio ben scritto sulla storia di Python e sulla sua diffusione nello sviluppo web, citando brevemente Flask e Django, ma senza elencare 5 framework.
Quale criterio non viene soddisfatto in modo più grave da questa risposta?
Riepilogo: leggere e valutare gli output dell'IA
La scrittura di prompt efficaci è un processo in due fasi: elaborare il prompt e valutare la risposta.
I quattro criteri — Rilevanza, Accuratezza, Completezza, Formato — offrono un metodo sistematico per valutare qualsiasi output dell'IA. Ogni criterio non soddisfatto indica esattamente quale tipo di follow-up scrivere.
Nella prossima lezione, farà pratica nello scrivere prompt di follow-up per correggere specifici tipi di errore.
Domande Frequenti
La lezione «Leggere e valutare gli output dell'IA» è gratuita?
Sì — il testo completo di «Leggere e valutare gli output dell'IA» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Prompt Engineering, passa a CoddyKit PRO. Il corso AI Prompt Engineering include 4 lezioni in totale.
Cosa imparerò in «Leggere e valutare gli output dell'IA»?
Criteri per valutare rilevanza, accuratezza e completezza delle risposte dell'IA Eserciti AI Prompt Engineering con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare AI Prompt Engineering?
Non è richiesta alcuna esperienza precedente. AI Prompt Engineering su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 1 di 4.
Quanto tempo richiede la lezione «Leggere e valutare gli output dell'IA»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione AI Prompt Engineering?
Sì. Ogni lezione AI Prompt Engineering include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Leggere e valutare gli output dell'IA
- Scrivere prompt di follow-up efficaci
- Sviluppare le risposte precedenti
- Quando perfezionare o ricominciare da capo