AI Engineering Academy · Lektion

RAG vs. Fine-Tuning: Wann welcher Ansatz geeignet ist

Sie vergleichen RAG und Fine-Tuning hinsichtlich Aktualität des Wissens, Kosten, Latenz und Implementierungskomplexität, um für verschiedene reale Szenarien den passenden Ansatz zu bestimmen.

Lektion 4 von 413 Schritte

RAG vs. Fine-Tuning: Wann welcher Ansatz geeignet ist ist eine kostenlose AI Engineering Academy-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Engineering Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Engineering Academy-Kurs umfasst insgesamt 4 Lektionen.

Zwei Strategien, unterschiedliche Ziele

Wenn ein LLM in Ihrem spezifischen Fachgebiet gut funktionieren soll, haben Sie zwei Hauptstrategien: Retrieval-Augmented Generation (RAG) fügt zur Inferenzzeit dynamisch relevantes Wissen ein, während Fine-Tuning die Gewichte des Modells aktualisiert, um Wissen, Stil oder Formatpräferenzen fest zu verankern. Die richtige Entscheidung zwischen beiden kann den Unterschied zwischen einem zuverlässigen System und monatelanger, teurer GPU-Rechenzeit ausmachen, die für den falschen Ansatz verschwendet wird.

Was Fine-Tuning tatsächlich verändert

Beim Fine-Tuning werden die Gewichte des Modells aktualisiert, indem es mit Beispielen für Eingaben und Ausgaben trainiert wird. Besonders gut eignet es sich zur Veränderung des Verhaltens: Sie können einem Modell beibringen, immer ein bestimmtes JSON-Format zu verwenden, eine Markenstimme anzunehmen, domänenspezifischen Denkmustern zu folgen oder eine Aufgabenart auszuführen, für die es nicht optimiert wurde. Fine-Tuning aktualisiert faktisches Wissen nicht zuverlässig – Modelle können sich an Trainingsbeispiele überanpassen, ohne die zugrunde liegenden Fakten auf neue Anfragen zu übertragen.

# Fine-tuning training example format (JSONL)
# {"messages": [
#   {"role": "system", "content": "You extract order info as JSON."},
#   {"role": "user",   "content": "Order #1234 for 3 widgets at $9.99 each"},
#   {"role": "assistant", "content": '{"order_id": "1234", "qty": 3, "unit_price": 9.99}'}
# ]}

# Good fine-tuning use case: consistent output FORMAT
# Bad fine-tuning use case: teaching the model your 2025 product catalog facts

Was RAG tatsächlich verändert

RAG verändert die Modellgewichte nicht. Stattdessen ändert es die Informationen, die dem Modell zur Inferenzzeit zur Verfügung stehen, indem relevante Dokumente im Kontextfenster platziert werden. RAG eignet sich besonders für Wissen: zum Beantworten von Fragen zu privaten Dokumenten, zum Aktualisieren von Antworten bei häufig geänderten Daten und zur Verankerung von Antworten in überprüfbaren Quellen. Was RAG nicht ohne Weiteres verändert, sind der inhärente Stil, Formatpräferenzen oder der Denkansatz des Modells.

Aktualität des Wissens: RAG ist überlegen

Für jeden Anwendungsfall, bei dem sich Informationen im Laufe der Zeit ändern, ist RAG eindeutig überlegen. Einen Vektorspeicher nach Änderungen an Dokumenten neu zu indizieren dauert Minuten und benötigt keine GPU-Ressourcen. Das Fine-Tuning eines Modells mit neuen Daten erfordert erneutes Training, das teuer und langsam ist; selbst dann ruft das Modell die neuen Fakten möglicherweise nicht zuverlässig ab. Produktkataloge, gesetzliche Vorschriften, medizinische Leitlinien und Unternehmensrichtlinien sind mit RAG besser abgedeckt als mit Fine-Tuning.

Konsistenz von Stil und Format: Fine-Tuning ist überlegen

Wenn das Modell stets in einem ganz bestimmten Stil, Ton oder strukturierten Format antworten soll, das sich allein durch Prompt Engineering nicht zuverlässig erzwingen lässt, ist Fine-Tuning das richtige Werkzeug. Beispiele: ein Kundendienst-Bot, der immer das spezifische Vokabular Ihrer Marke verwenden muss; ein Codegenerator, der Code passend zum internen Styleguide Ihres Unternehmens erzeugen muss; oder ein Klassifizierungsmodell, das über Tausende von Sonderfällen hinweg zuverlässig eine unveränderliche Taxonomie ausgeben muss.

Kostenvergleich

Fine-Tuning verursacht hohe anfängliche Kosten (Rechenaufwand für das Training, Zeit für die Vorbereitung des Datensatzes und Evaluierung), senkt aber die Kosten pro Anfrage, wenn Sie dadurch ein kleineres Modell verwenden können. RAG hat geringe anfängliche Kosten (die Indizierung einer Vektordatenbank ist günstig), verursacht aber zusätzlichen Aufwand pro Anfrage: einen Aufruf der Embedding-API sowie etwas längere Prompts mit eingefügtem Kontext. Bei den meisten Anwendungen mit weniger als 10 Millionen täglichen Anfragen ist der zusätzliche Aufwand pro Anfrage bei RAG im Vergleich zu den Entwicklungskosten des Fine-Tunings vernachlässigbar.

# RAG per-query cost estimate
EMBED_COST_PER_1K_TOKENS = 0.00002  # text-embedding-3-small
LLM_INPUT_COST_PER_1K = 0.0025     # gpt-4o input

query_embed_cost = (10 / 1000) * EMBED_COST_PER_1K_TOKENS    # ~10 token query
context_cost = (1500 / 1000) * LLM_INPUT_COST_PER_1K         # 5 chunks * 300 tokens

print(f'RAG overhead per query: ${query_embed_cost + context_cost:.5f}')
# About $0.004 extra per query — negligible at moderate scale

Latenzvergleich

Fine-getunte Modelle können bei der Inferenz schneller sein, da kürzere Prompts erforderlich sind – das Wissen steckt in den Gewichten und nicht im Kontext. RAG fügt zwei Roundtrips hinzu: einen Aufruf der Embedding-API und eine Suchanfrage an die Vektordatenbank. Der gesamte zusätzliche Aufwand beträgt typischerweise 50–200 ms. Bei latenzsensitiven Anwendungen wie Echtzeit-Sprachassistenten ist dieser Aufwand relevant. Bei den meisten Chat- und Frage-Antwort-Anwendungen ist die zusätzliche Latenz für Benutzer nicht wahrnehmbar.

Transparenz und Auditierbarkeit

RAG bietet eine klare Prüfspur: Für jede Antwort wissen Sie genau, welche Dokumente abgerufen wurden, und können sie dem Benutzer anzeigen. Fine-getunte Modelle antworten aus undurchsichtigen Gewichten – es gibt keine Aufzeichnung darüber, welches Trainingsbeispiel eine bestimmte Ausgabe hervorgebracht hat. In regulierten Branchen wie Finanzwesen, Gesundheitswesen und Rechtswesen, in denen Antworten erklärbar und überprüfbar sein müssen, ist die Transparenz von RAG ein wesentlicher Vorteil gegenüber Fine-Tuning.

Wann beide Ansätze kombiniert werden sollten

RAG und Fine-Tuning schließen einander nicht aus. Ein gängiges Muster in Produktionssystemen ist: Sie führen ein Fine-Tuning durch, damit das Modell ein konsistentes Ausgabeformat und domänenspezifisches Vokabular verwendet, und ergänzen anschließend RAG, um aktuelles Faktenwissen bereitzustellen. Das fine-getunte Modell übernimmt zuverlässig Stil und Struktur, während RAG das Wissen liefert. Bei anspruchsvollen Unternehmensanwendungen übertrifft diese Kombination beide Ansätze allein.

Entscheidungsablauf

Folgen Sie diesem Entscheidungsweg: Geht es um Konsistenz von Stil oder Format? → Ziehen Sie Fine-Tuning in Betracht. Sind die Informationen privat oder werden sie häufig aktualisiert? → Verwenden Sie RAG. Benötigen Sie Quellenangaben? → Verwenden Sie RAG. Ist der Datensatz zu klein für Fine-Tuning (unter 500 Beispiele)? → Verwenden Sie RAG mit Few-Shot-Prompting. Muss das Modell eine Aufgabe bewältigen, die es derzeit ablehnt? → Führen Sie Fine-Tuning mit RLHF oder DPO durch. Beginnen Sie im Zweifelsfall mit RAG – es lässt sich schneller entwickeln, leichter aktualisieren und transparenter gestalten.

Beispiele aus der Praxis

Nutzen Sie diese Szenarien, um ein Gefühl für die Unterschiede zu entwickeln: Interner HR-Chatbot (Richtlinien ändern sich vierteljährlich, Quellenangaben sind erforderlich) → RAG. Codevervollständigung für ein proprietäres Framework (konsistenter Codestil, Framework-Muster) → Fine-Tuning. Frage-Antwort-System für juristische Dokumente (private Dokumente, präzise Quellenangaben erforderlich) → RAG. Kundensupport-Bot (bestimmter Ton, Produkt-FAQ wird wöchentlich aktualisiert) → Fine-Tuning für den Ton + RAG für das Wissen. Zusammenfasser medizinischer Fachliteratur (aktuelle Forschung, Zuordnung zu Quellen entscheidend) → RAG.

Schnelltest

Testen Sie Ihr Verständnis der Konzepte des AI Engineering aus dieser Lektion.

Zusammenfassung der Lektion

In dieser Lektion haben Sie gelernt: Fine-Tuning verändert Verhalten und Stil des Modells, aber nicht zuverlässig das faktische Wissen; RAG stellt zur Inferenzzeit dynamisch Wissen bereit, mit vollständiger Transparenz und Quellenangaben; außerdem haben Sie das Entscheidungsmodell kennengelernt: Verwenden Sie RAG für häufig aktualisiertes privates Wissen, bei dem eine Zuordnung zu Quellen erforderlich ist, Fine-Tuning für konsistenten Stil und konsistente Formate und beide Ansätze gemeinsam für anspruchsvolle Unternehmensanwendungen. Als Nächstes beginnen wir damit, eine vollständige RAG-Pipeline von Grund auf zu entwickeln.

Kostenlos starten

Lerne Python mit einem KI-Tutor — kostenlos

Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.

Kurse
30
Lektionen
120

Häufig gestellte Fragen

Ist die Lektion „RAG vs. Fine-Tuning: Wann welcher Ansatz geeignet ist“ kostenlos?

Ja — der vollständige Text von „RAG vs. Fine-Tuning: Wann welcher Ansatz geeignet ist“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Engineering Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Engineering Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „RAG vs. Fine-Tuning: Wann welcher Ansatz geeignet ist“?

Sie vergleichen RAG und Fine-Tuning hinsichtlich Aktualität des Wissens, Kosten, Latenz und Implementierungskomplexität, um für verschiedene reale Szenarien den passenden Ansatz zu bestimmen. Du übst AI Engineering Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Engineering Academy zu starten?

Keine Vorkenntnisse erforderlich. AI Engineering Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.

Wie lange dauert die Lektion „RAG vs. Fine-Tuning: Wann welcher Ansatz geeignet ist“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Engineering Academy-Lektion Code schreiben und ausführen?

Ja. Jede AI Engineering Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Das Problem, das RAG löst
  2. Die RAG-Architektur: Indexierung und Retrieval
  3. Den erweiterten Prompt erstellen
  4. RAG vs. Fine-Tuning: Wann welcher Ansatz geeignet ist
← Zurück zu AI Engineering Academy