0Pricing
AI Engineering Academy · Lektion

Das Problem, das RAG löst

Sie untersuchen reale Fälle, in denen LLMs veraltete oder falsche Informationen halluzinieren, und verstehen, wie die Verankerung von Antworten in abgerufenen Dokumenten diese Probleme behebt.

Das Problem, das RAG löst ist eine kostenlose AI Engineering Academy-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Engineering Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Engineering Academy-Kurs umfasst insgesamt 4 Lektionen.

LLMs haben einen Wissensstichtag

Jedes Large Language Model wird anhand einer Momentaufnahme des Internets trainiert, die bis zu einem bestimmten Datum reicht, dem sogenannten Wissensstichtag. Der Wissensstichtag von GPT-4o liegt Anfang 2024. Fragen Sie nach Ereignissen, die danach stattgefunden haben, wird das Modell entweder seine Unwissenheit eingestehen oder, schlimmer noch, selbstbewusst plausibel klingende, aber falsche Informationen erfinden. Für Anwendungen, die aktuelles oder proprietäres Wissen benötigen, ist dies ein grundlegendes Problem.

Das Halluzinationsproblem

Halluzinationen treten auf, wenn ein LLM Text erzeugt, der überzeugend klingt, aber faktisch falsch ist. Modelle werden darauf trainiert, flüssigen und schlüssigen Text zu erzeugen – sie werden nicht ausdrücklich darauf trainiert, die Antwort zu verweigern, wenn sie etwas nicht wissen. Daher füllen sie Wissenslücken mit plausiblen Vermutungen. Studien zeigen, dass selbst die besten Modelle bei wissensintensiven Aufgaben in 10–40 % der Fälle halluzinieren, wenn keine externe Fundierung vorliegt.

Ein konkretes Beispiel für eine Halluzination

Stellen Sie sich vor, Sie fragen ein LLM: Wie lauten die Bedingungen für den Lieferantenvertrag unseres Unternehmens für das 3. Quartal 2025? Das Modell hat Ihr internes Dokument nie gesehen. Statt zu sagen, dass es die Antwort nicht kennt, erstellt es möglicherweise eine plausibel klingende Zusammenfassung des Vertrags mit allgemeiner Rechtssprache. Wenn ein Mitarbeiter auf Grundlage dieser erfundenen Informationen handelt, können die Folgen schwerwiegend sein. Genau diese Art von Fehler sollte RAG verhindern.

# Without RAG — LLM guesses from parametric memory
response = client.chat.completions.create(
    model='gpt-4o',
    messages=[
        {'role': 'user',
         'content': 'What are our Q3 2025 vendor contract terms?'}
    ]
)
# Model has no access to your documents — may hallucinate
print(response.choices[0].message.content)

Grounding verhindert Halluzinationen

Die grundlegende Idee hinter RAG ist einfach: Wenn Sie dem Modell die relevanten Informationen innerhalb des Prompts zur Verfügung stellen, muss es sich nicht auf gespeichertes Wissen verlassen. Das Modell wechselt vom Generieren aus dem Gedächtnis zum Lesen aus dem Kontext. Genauso arbeiten auch Menschen – wenn Sie genaue Details benötigen, schlagen Sie sie nach, statt sich auf Ihre Erinnerung zu verlassen. RAG setzt denselben Arbeitsablauf für LLMs praktisch um.

# With RAG — answer grounded in retrieved documents
context = retrieve_relevant_chunks(query='Q3 2025 vendor contract terms')

response = client.chat.completions.create(
    model='gpt-4o',
    messages=[
        {'role': 'system', 'content': 'Answer using only the provided context.'},
        {'role': 'user', 'content': f'Context: {context}\n\nQuestion: What are our Q3 2025 vendor contract terms?'}
    ]
)

Statisches Fine-Tuning hilft hier nicht

Ein verbreitetes Missverständnis ist, dass Fine-Tuning des Modells mit Ihren Dokumenten Halluzinationen behebt. Fine-Tuning aktualisiert die Gewichte des Modells, um Stil, Format und Befolgung von Aufgabenstellungen zu verbessern, fügt jedoch nicht zuverlässig faktisches Wissen hinzu. Studien zeigen, dass feinabgestimmte Modelle selbst bei den Trainingsdaten weiterhin halluzinieren. Damit Wissen zuverlässig abgerufen werden kann, muss es zum Inferenzzeitpunkt über das Kontextfenster bereitgestellt werden.

RAG ermöglicht Wissen in Echtzeit

Da RAG aus einem aktuellen Dokumentenspeicher abruft, kann es ganz natürlich mit Wissen umgehen, das sich im Laufe der Zeit ändert. Wenn Ihr Richtliniendokument aktualisiert wird, indizieren Sie es neu, und jede anschließende Abfrage verwendet sofort die neue Version – ein erneutes Training des Modells ist nicht erforderlich. Dadurch ist RAG für Anwendungen wie interne Wissensdatenbanken, Kundensupportsysteme und Tools für Finanzrecherchen wesentlich praktischer als regelmäßiges Fine-Tuning.

RAG funktioniert mit privaten, proprietären Daten

Die meisten Unternehmensdaten dürfen aufgrund von Anforderungen an Datenschutz und Compliance nicht zum Training an OpenAI gesendet werden. RAG umgeht dieses Problem: Ihre vertraulichen Dokumente bleiben in Ihrer eigenen Vektordatenbank, und pro Abfrage werden nur die relevanten Abschnitte an das LLM gesendet. Sie können sogar ein lokales LLM wie Llama 3 ausführen, damit alle Daten vor Ort bleiben. RAG ist das wichtigste Muster für die Entwicklung von KI auf vertraulichen Unternehmensinhalten.

RAG ermöglicht die Zuordnung von Quellen

Wenn ein LLM aus dem Gedächtnis generiert, gibt es keine Quelle, die es zitieren kann. Wenn es aus abgerufenen Dokumenten generiert, kann es die genauen Quellen zitieren. Sie können das Modell anweisen, Dokumentnamen und Seitenzahlen in seine Antwort aufzunehmen, sodass Benutzer die Originalquelle öffnen und überprüfen können. Die Zuordnung von Quellen erhöht das Vertrauen in KI-generierte Antworten erheblich – ein entscheidender Faktor für Anwendungen im Rechtswesen, in der Medizin und im Finanzbereich.

system_prompt = '''You are a helpful assistant.
Answer questions using ONLY the provided context.
At the end of your answer, list the sources you used
in this format: [Source: document_name, page X]
If the context does not contain the answer, say:
"I don't have that information in the provided documents."'''

Das Muster „Abrufen, dann Generieren“

RAG folgt zum Inferenzzeitpunkt einem zweistufigen Muster: Abrufen – die Benutzerfrage in ein Embedding umwandeln, im Vektorspeicher nach den relevantesten Dokumentabschnitten suchen und die Top-K-Ergebnisse sammeln. Generieren – einen Prompt erstellen, der die abgerufenen Abschnitte als Kontext enthält, und das LLM auffordern, die Frage ausschließlich auf Grundlage dieses Kontexts zu beantworten. Das LLM liest, fasst zusammen und antwortet.

def answer_with_rag(user_question, vector_store, llm_client):
    # Step 1: Retrieve
    query_embedding = embed(user_question)
    chunks = vector_store.search(query_embedding, top_k=5)
    context = '\n\n'.join([c['text'] for c in chunks])

    # Step 2: Generate
    response = llm_client.chat.completions.create(
        model='gpt-4o',
        messages=[
            {'role': 'system', 'content': f'Answer using only:\n{context}'},
            {'role': 'user', 'content': user_question}
        ]
    )
    return response.choices[0].message.content

Was RAG nicht löst

RAG ist leistungsfähig, aber kein Allheilmittel. Es scheitert weiterhin, wenn die Antwort eine Zusammenführung aus Hunderten von Dokumenten erfordert (der Abruf liefert nur wenige Abschnitte), die Frage grundsätzlich mehrstufig ist und das Modell über Zwischenschritte hinweg schlussfolgern muss oder die abgerufenen Abschnitte irreführend oder widersprüchlich sind. Wenn Sie diese Grenzen verstehen, können Sie hybride Systeme entwickeln, die RAG mit Reasoning-Agenten kombinieren.

RAG im Vergleich zu den Alternativen

Für die Vermittlung von Domänenwissen an ein LLM stehen Ihnen drei Hauptoptionen zur Verfügung: Prompt Stuffing (alles in den Prompt aufnehmen – funktioniert nur bei sehr kleinen Korpora), Fine-Tuning (trainiert Stil und Format gut, ist aber für den zuverlässigen Abruf von Fakten ungeeignet) und RAG (ruft relevante Fakten zum Inferenzzeitpunkt dynamisch ab und lässt sich auf Millionen von Dokumenten skalieren). Für die meisten produktiven Anwendungsfälle, die aktuelles, privates oder umfangreiches Wissen erfordern, ist RAG die richtige Wahl.

Schnelltest

Testen Sie Ihr Verständnis der Konzepte aus dem Bereich AI Engineering in dieser Lektion.

Zusammenfassung der Lektion

In dieser Lektion haben Sie gelernt: warum LLMs halluzinieren – aufgrund von Wissensgrenzen und der Unfähigkeit, „Ich weiß es nicht“ zu sagen –, warum Fine-Tuning Halluzinationen beim Abruf von Fakten nicht behebt, und wie RAG Antworten auf abgerufene Dokumente stützt und dadurch die Zuordnung von Quellen, aktuelles Wissen und die sichere Nutzung privater Daten ermöglicht. Als Nächstes untersuchen wir die vollständige RAG-Architektur einschließlich ihrer Phasen für Indizierung und Abruf.

Häufig gestellte Fragen

Ist die Lektion „Das Problem, das RAG löst“ kostenlos?

Ja — der vollständige Text von „Das Problem, das RAG löst“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Engineering Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Engineering Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Das Problem, das RAG löst“?

Sie untersuchen reale Fälle, in denen LLMs veraltete oder falsche Informationen halluzinieren, und verstehen, wie die Verankerung von Antworten in abgerufenen Dokumenten diese Probleme behebt. Du übst AI Engineering Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Engineering Academy zu starten?

Keine Vorkenntnisse erforderlich. AI Engineering Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.

Wie lange dauert die Lektion „Das Problem, das RAG löst“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Engineering Academy-Lektion Code schreiben und ausführen?

Ja. Jede AI Engineering Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Das Problem, das RAG löst
  2. Die RAG-Architektur: Indexierung und Retrieval
  3. Den erweiterten Prompt erstellen
  4. RAG vs. Fine-Tuning: Wann welcher Ansatz geeignet ist
← Zurück zu AI Engineering Academy