Was RAG löst (Wissensstichtag, Halluzinationen)
RAG ruft zum Abfragezeitpunkt relevanten Kontext ab, damit das LLM echte Quellen zitiert, statt Fakten zu erfinden.
Was RAG löst (Wissensstichtag, Halluzinationen) ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Zwei Probleme mit reinen LLMs
Selbst die besten LLMs haben zwei strukturelle Probleme:
- Wissensgrenze — sie kennen nur, was in ihren Trainingsdaten enthalten war. Fragen Sie GPT-4 nach einem Ereignis von gestern, weiß es nichts darüber.
- Halluzination — wenn das Modell etwas nicht weiß, erfindet es selbstbewusst Inhalte.
Was RAG ist
Retrieval-Augmented Generation (RAG) bedeutet:
- Eine Wissensdatenbank nach relevanten Chunks durchsuchen
- Diese Chunks in den Prompt einfügen
- Das LLM auffordern, die Antwort AUSSCHLIESSLICH anhand dieser Chunks zu erstellen
Das Modell wird zu einem "Leser" externer Wissensquellen, statt sich auf seine unveränderlichen Gewichte zu verlassen.
Ein konkretes Beispiel
Benutzer: "Wie lautet unsere Rückgaberegelung für geöffnete Elektronikartikel?"
- Die Unternehmenswissensdatenbank nach "Rückgaberegelung Elektronik" durchsuchen — 3 Absätze aus den Hilfedokumenten abrufen
- Den Prompt erstellen: "Beantworten Sie die Frage anhand des folgenden Kontexts: ..."
- Das Modell erstellt eine zuverlässige Antwort mit Quellenangaben
Warum RAG Fine-Tuning überlegen ist
Für Faktenwissen ist RAG besser als Fine-Tuning, weil:
- Sie die Wissensdatenbank ohne erneutes Training aktualisieren können
- Daten pro Benutzer oder Mandant problemlos getrennt werden können
- Quellenangaben möglich sind (Sie wissen, WELCHER Chunk die Antwort erzeugt hat)
- Die Wartung günstiger ist
Warum RAG Halluzinationen reduziert
Wenn das Modell angewiesen wird, AUSSCHLIESSLICH aus dem bereitgestellten Kontext zu antworten, und der Kontext die Wahrheit enthält, ist es deutlich wahrscheinlicher, dass es korrekt antwortet, als wenn es sich auf sein Gedächtnis verlässt.
Das ist nicht perfekt — Modelle erfinden gelegentlich trotzdem Inhalte —, aber Halluzinationen werden drastisch reduziert.
Die drei Phasen
Jedes RAG-System hat drei Phasen:
- Ingestion (offline) — Dokumente in Chunks aufteilen, Embeddings erzeugen, speichern
- Retrieval (online) — Query als Embedding abbilden, die Top-K-Chunks finden
- Generation (online) — Das LLM erzeugt mithilfe der abgerufenen Chunks eine Antwort
Naives RAG vs. fortgeschrittenes RAG
Naives RAG (Prototyp mit 5 Zeilen):
- Chunking mit fester Größe
- Retrieval mit einem einzelnen Vektor
- Die Top-K-Chunks in den Prompt einfügen
Fortgeschrittenes RAG ergänzt Re-Ranking, Query-Rewriting, HyDE, Multi-Vector und Evaluierung — all das verbessert die Qualität, erhöht aber auch die Komplexität.
Wann RAG hilft
- Unternehmenswissensdatenbanken und -dokumente
- Kundensupport anhand eines Produkthandbuchs
- Faktische Fragen und Antworten zu seltenen Themen
- Persönliche Assistenten für Benutzerdaten
Wann RAG schadet
- Einfacher Small Talk (keine Fakten erforderlich)
- Aufgaben, die Schlussfolgerungen statt Fakten erfordern
- Wenn das Korpus klein genug ist, um ohnehin in den Kontext zu passen
Das Prompt-Template
Ein typischer RAG-Prompt sieht so aus:
prompt = f'''
Answer the user\'s question using ONLY the context below.
If the answer is not in the context, say 'I do not know'.
Context:
{retrieved_chunks}
Question:
{user_question}
Answer:
'''Quellenangaben
Formatieren Sie Chunks mit Quellen-IDs und fordern Sie das Modell auf, diese zu zitieren:
context = '\n'.join(
f'[doc {i+1}] {chunk.text}'
for i, chunk in enumerate(chunks)
)
# Then ask: 'Cite the relevant [doc N] for each claim.'RAG-Ziel
Welches Problem adressiert RAG in erster Linie?
Zusammenfassung
RAG macht aus LLMs Testteilnehmer mit offenem Buch. Als Nächstes geht es darum, wie Dokumente für das Retrieval tatsächlich in Chunks aufgeteilt werden.
Häufig gestellte Fragen
Ist die Lektion „Was RAG löst (Wissensstichtag, Halluzinationen)“ kostenlos?
Ja — der vollständige Text von „Was RAG löst (Wissensstichtag, Halluzinationen)“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Was RAG löst (Wissensstichtag, Halluzinationen)“?
RAG ruft zum Abfragezeitpunkt relevanten Kontext ab, damit das LLM echte Quellen zitiert, statt Fakten zu erfinden. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Agents zu starten?
Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.
Wie lange dauert die Lektion „Was RAG löst (Wissensstichtag, Halluzinationen)“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?
Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Was RAG löst (Wissensstichtag, Halluzinationen)
- Chunking-Strategien (fest, satzbasiert, semantisch)
- Eine Dokumentmenge indexieren
- Ein naives RAG mit FAISS oder Chroma erstellen