Cosa risolve RAG (limite di conoscenza e allucinazioni)
RAG recupera il contesto pertinente al momento della query, così l'LLM cita fonti reali invece di inventare fatti.
Cosa risolve RAG (limite di conoscenza e allucinazioni) è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 1 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.
Due problemi degli LLM standard
Anche i migliori LLM presentano due problemi strutturali:
- Data limite della conoscenza — conoscono solo ciò che era presente nei dati di addestramento. Se chiede a GPT-4 informazioni su un evento di ieri, non ne sa nulla.
- Allucinazioni — quando il modello non sa qualcosa, inventa una risposta con sicurezza.
Che cos'è RAG
Retrieval-Augmented Generation (RAG) significa:
- Cercare in una knowledge base i segmenti pertinenti
- Inserire questi segmenti nel prompt
- Chiedere all'LLM di rispondere usando SOLO quei segmenti
Il modello diventa un "lettore" della conoscenza esterna, invece di affidarsi ai propri pesi congelati.
Un esempio concreto
Utente: "Qual è la nostra politica di reso per i dispositivi elettronici aperti?"
- Cercare nella KB aziendale "politica di reso dispositivi elettronici" e ottenere 3 paragrafi dalla documentazione di supporto
- Creare il prompt: "Utilizzando il contesto seguente, risponda: ..."
- Il modello produce una risposta fedele con citazioni
Perché RAG è meglio del fine-tuning
Per la conoscenza fattuale, RAG > fine-tuning perché:
- Può aggiornare la KB senza riaddestrare il modello
- I dati per utente o tenant sono separati in modo immediato
- Le citazioni sono possibili (sa QUALE segmento ha prodotto la risposta)
- È più economico da mantenere
Perché RAG riduce le allucinazioni
Se il modello riceve istruzioni per rispondere SOLO in base al contesto fornito e il contesto contiene la verità, è molto più probabile che risponda correttamente rispetto a quando si affida alla memoria.
Non è perfetto: i modelli a volte inventano comunque informazioni, ma le allucinazioni diminuiscono drasticamente.
Le tre fasi
Ogni sistema RAG comprende tre fasi:
- Ingestione (offline) — suddividere i documenti in chunk, creare gli embedding, memorizzarli
- Recupero (online) — creare l'embedding della query, trovare i chunk Top-K
- Generazione (online) — l'LLM produce la risposta usando i chunk recuperati
RAG naive e RAG avanzato
RAG naive (prototipo di 5 righe):
- Suddivisione in chunk di dimensione fissa
- Recupero con un singolo vettore
- Inserimento dei Top-K nel prompt
Il RAG avanzato aggiunge riordinamento, riscrittura delle query, HyDE, più vettori e valutazione: ogni elemento migliora la qualità, ma aumenta anche la complessità.
Quando RAG è utile
- Knowledge base e documentazione aziendali
- Supporto clienti basato sul manuale di un prodotto
- Domande e risposte fattuali su argomenti specifici
- Assistenti personali basati sui dati dell'utente
Quando RAG peggiora i risultati
- Conversazioni informali semplici (non servono informazioni fattuali)
- Attività che richiedono ragionamento, non nozioni
- Quando il corpus è abbastanza piccolo da rientrare comunque nel contesto
Il template del prompt
Un prompt RAG tipico ha questo aspetto:
prompt = f'''
Answer the user\'s question using ONLY the context below.
If the answer is not in the context, say 'I do not know'.
Context:
{retrieved_chunks}
Question:
{user_question}
Answer:
'''Citazioni
Formatti i chunk con gli ID delle fonti e chieda al modello di citarli:
context = '\n'.join(
f'[doc {i+1}] {chunk.text}'
for i, chunk in enumerate(chunks)
)
# Then ask: 'Cite the relevant [doc N] for each claim.'Obiettivo di RAG
Quale problema affronta principalmente RAG?
Riepilogo
RAG trasforma gli LLM in studenti che svolgono un test a libro aperto. Prossimo argomento: come suddividere concretamente i documenti per il recupero.
Domande Frequenti
La lezione «Cosa risolve RAG (limite di conoscenza e allucinazioni)» è gratuita?
Sì — il testo completo di «Cosa risolve RAG (limite di conoscenza e allucinazioni)» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.
Cosa imparerò in «Cosa risolve RAG (limite di conoscenza e allucinazioni)»?
RAG recupera il contesto pertinente al momento della query, così l'LLM cita fonti reali invece di inventare fatti. Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare AI Agents?
Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 1 di 4.
Quanto tempo richiede la lezione «Cosa risolve RAG (limite di conoscenza e allucinazioni)»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione AI Agents?
Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Cosa risolve RAG (limite di conoscenza e allucinazioni)
- Strategie di chunking (fisso, per frasi, semantico)
- Indicizzare un insieme di documenti
- Creare un RAG ingenuo con FAISS o Chroma