0Pricing
AI Agents · Lezione

Valutazione RAG (RAGAS, Recall@K)

Misuri fedeltà, pertinenza della risposta, precisione del contesto e recall@K per capire se le modifiche portano miglioramenti.

Valutazione RAG (RAGAS, Recall@K) è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.

Non si può migliorare ciò che non si può misurare

Il RAG ha molti parametri: dimensione dei chunk, top-K, reranker, prompt, modello. Senza metriche, ogni modifica è un tentativo alla cieca.

Metriche chiave per il RAG

  1. Recupero: abbiamo recuperato i chunk corretti?
  2. Fedeltà: la risposta rimane ancorata ai chunk?
  3. Rilevanza della risposta: la risposta affronta la domanda?
  4. Precisione/recall del contesto: rapporto tra i chunk utili recuperati

Recall@K

Crei un gold set di coppie (question, list-of-relevant-chunk-ids). Misuri con quale frequenza i chunk recuperati nei primi K ne contengono almeno uno pertinente:

def recall_at_k(eval_set, k=5):
    hits = 0
    for item in eval_set:
        retrieved = retriever(item['question'], k=k)
        if any(c.id in item['relevant_ids'] for c in retrieved):
            hits += 1
    return hits / len(eval_set)

Precision@K

Quale frazione dei chunk recuperati è pertinente?

def precision_at_k(eval_set, k=5):
    total_relevant = 0
    total_retrieved = 0
    for item in eval_set:
        retrieved = retriever(item['question'], k=k)
        total_relevant += sum(1 for c in retrieved if c.id in item['relevant_ids'])
        total_retrieved += k
    return total_relevant / total_retrieved

MRR (Mean Reciprocal Rank)

Quanto in alto è classificato il PRIMO documento pertinente?

def mrr(eval_set, k=10):
    total = 0
    for item in eval_set:
        retrieved = retriever(item['question'], k=k)
        for rank, c in enumerate(retrieved, start=1):
            if c.id in item['relevant_ids']:
                total += 1 / rank
                break
    return total / len(eval_set)

Fedeltà (LLM-as-Judge)

Utilizzi un LLM per verificare se ogni affermazione della risposta è supportata dal contesto:

judge_prompt = '''
Given the context and answer, identify each factual claim in the answer.
For each claim, judge whether the context supports it.
Return {claims: [{claim, supported: true/false}]}.
'''
result = judge_llm.invoke(judge_prompt.format(context=ctx, answer=ans))

Rilevanza della risposta

Valutazione inversa: chieda a un LLM «Questa risposta potrebbe rispondere a questa domanda?». In questo modo individua gli output fuori tema.

Framework RAGAS

RAGAS automatizza le metriche precedenti:

# pip install ragas
from ragas import evaluate
from ragas.metrics import faithfulness, answer_relevancy, context_precision, context_recall

results = evaluate(
    dataset,            # HF dataset with question, contexts, answer, ground_truth
    metrics=[faithfulness, answer_relevancy, context_precision, context_recall]
)
print(results)

Creazione di un gold set

20-200 tuple (question, expected_answer, relevant_chunks) curate da persone. Includa:

  • Query comuni
  • Casi limite
  • Input avversari, cioè domande fuori dal corpus

Dataset di valutazione sintetici

Avvio: chieda a un LLM di generare coppie di domande e risposte dai suoi documenti. La qualità è inferiore, ma il processo è rapido:

synth_prompt = 'Read this document and write 3 questions a user might ask, with answers from the doc:\n{doc}'
# Use as a starting point; humans curate later.
print(synth_prompt)

Dataset di LangSmith e Langfuse

Entrambi gli strumenti permettono di trasformare le tracce di produzione in dataset di valutazione. Scelga 50 domande reali che hanno prodotto risultati insoddisfacenti, annoti le risposte corrette e utilizzi il risultato come benchmark.

Non ottimizzi eccessivamente una sola metrica

Massimizzare Recall@K può danneggiare Precision@K, producendo troppi falsi positivi. Monitori più metriche e una metrica composita.

Test A/B in produzione

Quando dispone di una valutazione offline correlata alla soddisfazione degli utenti, può testare in produzione le modifiche con un test A/B e confrontare sia le metriche sia le percentuali di valutazioni positive degli utenti.

Definizione di Recall@K

Che cosa significa Recall@5 = 0.8?

Riepilogo

Crei un gold set. Misuri Recall@K, Precision@K, MRR, Fedeltà e Rilevanza della risposta. Utilizzi RAGAS per automatizzare il processo. Iteri in base alle metriche.

Domande Frequenti

La lezione «Valutazione RAG (RAGAS, Recall@K)» è gratuita?

Sì — il testo completo di «Valutazione RAG (RAGAS, Recall@K)» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.

Cosa imparerò in «Valutazione RAG (RAGAS, Recall@K)»?

Misuri fedeltà, pertinenza della risposta, precisione del contesto e recall@K per capire se le modifiche portano miglioramenti. Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Agents?

Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.

Quanto tempo richiede la lezione «Valutazione RAG (RAGAS, Recall@K)»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Agents?

Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Riordinamento con cross-encoder
  2. HyDE: embedding di documenti ipotetici
  3. Retrieval multi-vettore (ColBERT)
  4. Valutazione RAG (RAGAS, Recall@K)
← Torna a AI Agents