RAG versus fine-tuning: wanneer gebruikt u welke aanpak?
U vergelijkt RAG en fine-tuning op het gebied van actualiteit van kennis, kosten, latency en implementatiecomplexiteit om te bepalen welke aanpak geschikt is voor verschillende praktijkscenario's.
RAG versus fine-tuning: wanneer gebruikt u welke aanpak? is een gratis AI Engineering Academy-les op CoddyKit. Dit is les 4 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject AI Engineering Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus AI Engineering Academy bevat in totaal 4 lessen.
Twee strategieën, verschillende doelen
Wanneer je wilt dat een LLM goed werkt voor jouw specifieke domein, heb je twee hoofdstrategieën: Retrieval-Augmented Generation (RAG) voegt tijdens inferentie dynamisch relevante kennis toe, terwijl fine-tuning de gewichten van het model bijwerkt om kennis, stijl of voorkeuren voor de indeling in het model vast te leggen. De juiste keuze kan het verschil betekenen tussen een betrouwbaar systeem en maanden aan dure GPU-berekeningen die aan de verkeerde aanpak zijn verspild.
Wat fine-tuning daadwerkelijk verandert
Fine-tuning werkt de gewichten van het model bij door te trainen op voorbeelden van invoer-uitvoerparen. Het is vooral geschikt om gedrag te veranderen: een model leren om altijd in een specifieke JSON-indeling te antwoorden, een merkstem aan te nemen, domeinspecifieke redeneerpatronen te volgen of een type taak uit te voeren waarvoor het niet is geoptimaliseerd. Fine-tuning werkt feitelijke kennis niet betrouwbaar bij — modellen kunnen zich te sterk aanpassen aan trainingsvoorbeelden zonder de onderliggende feiten te generaliseren naar nieuwe queries.
# Fine-tuning training example format (JSONL)
# {"messages": [
# {"role": "system", "content": "You extract order info as JSON."},
# {"role": "user", "content": "Order #1234 for 3 widgets at $9.99 each"},
# {"role": "assistant", "content": '{"order_id": "1234", "qty": 3, "unit_price": 9.99}'}
# ]}
# Good fine-tuning use case: consistent output FORMAT
# Bad fine-tuning use case: teaching the model your 2025 product catalog factsWat RAG daadwerkelijk verandert
RAG wijzigt de modelgewichten niet. In plaats daarvan verandert het de informatie die tijdens inferentie beschikbaar is voor het model door relevante documenten in het contextvenster te plaatsen. RAG is vooral geschikt voor kennis: vragen over privédocumenten beantwoorden, antwoorden actueel houden met regelmatig bijgewerkte gegevens en antwoorden baseren op controleerbare bronnen. Wat RAG niet eenvoudig verandert, is de aangeboren stijl, voorkeuren voor de indeling of redeneeraanpak van het model.
Actualiteit van kennis: RAG wint
Voor elk gebruiksscenario waarin informatie in de loop van de tijd verandert, is RAG duidelijk beter. Een vectoropslag opnieuw indexeren wanneer documenten worden bijgewerkt, duurt enkele minuten en vereist geen GPU-middelen. Een model fine-tunen met nieuwe gegevens vereist opnieuw trainen (duur en langzaam), en zelfs dan herinnert het model zich de nieuwe feiten mogelijk niet betrouwbaar. Productcatalogi, wettelijke voorschriften, medische richtlijnen en bedrijfsbeleid zijn allemaal beter geschikt voor RAG dan voor fine-tuning.
Consistentie van stijl en indeling: fine-tuning wint
Als je wilt dat het model altijd antwoordt in een zeer specifieke stijl, toon of gestructureerde indeling die je met prompt engineering alleen niet betrouwbaar kunt afdwingen, is fine-tuning het juiste hulpmiddel. Voorbeelden zijn een klantenservicebot die altijd de specifieke woordenschat van je merk moet gebruiken, een codegenerator die code moet produceren volgens de interne stijlgids van je bedrijf, of een classificatiemodel dat in duizenden randgevallen betrouwbaar een vaste taxonomie moet uitvoeren.
Kosten vergelijken
Fine-tuning heeft hoge aanloopkosten (rekenkracht voor het trainen, tijd voor het voorbereiden van de gegevensset en evaluatie), maar verlaagt de kosten per query als je dankzij fine-tuning een kleiner model kunt gebruiken. RAG heeft lage aanloopkosten (het indexeren van een vectordatabank is goedkoop), maar voegt overhead per query toe: een aanroep van een embedding-API plus iets langere prompts met ingevoegde context. Voor de meeste toepassingen met minder dan 10 miljoen dagelijkse queries is de overhead per query van RAG verwaarloosbaar vergeleken met de ontwikkelkosten van fine-tuning.
# RAG per-query cost estimate
EMBED_COST_PER_1K_TOKENS = 0.00002 # text-embedding-3-small
LLM_INPUT_COST_PER_1K = 0.0025 # gpt-4o input
query_embed_cost = (10 / 1000) * EMBED_COST_PER_1K_TOKENS # ~10 token query
context_cost = (1500 / 1000) * LLM_INPUT_COST_PER_1K # 5 chunks * 300 tokens
print(f'RAG overhead per query: ${query_embed_cost + context_cost:.5f}')
# About $0.004 extra per query — negligible at moderate scaleLatentie vergelijken
Fine-getunede modellen kunnen sneller zijn tijdens inferentie, omdat kortere prompts nodig zijn — de kennis staat in de gewichten en niet in de context. RAG voegt twee retourrondes toe: een aanroep van een embedding-API en een query naar de vectorzoekopdracht. De totale overhead bedraagt meestal 50-200 ms. Voor latentiegevoelige toepassingen, zoals realtime-spraakassistenten, is deze overhead belangrijk. Voor de meeste chat- en vraag-en-antwoordtoepassingen merken gebruikers de extra latentie niet.
Transparantie en controleerbaarheid
RAG biedt een duidelijk controlespoor: voor elk antwoord weet je precies welke documenten zijn opgehaald en kun je die aan de gebruiker tonen. Fine-getunede modellen antwoorden vanuit ondoorzichtige gewichten — er is geen registratie van welk trainingsvoorbeeld een bepaalde uitvoer heeft veroorzaakt. In gereguleerde sectoren zoals financiën, gezondheidszorg en recht, waar antwoorden uitlegbaar en controleerbaar moeten zijn, is de transparantie van RAG een belangrijk voordeel ten opzichte van fine-tuning.
Wanneer je beide combineert
RAG en fine-tuning sluiten elkaar niet uit. Een veelgebruikt patroon in productie is: fine-tune een model voor een consistente uitvoerindeling en domeinwoordenschat en voeg vervolgens RAG toe om actuele feitelijke kennis aan te leveren. Het fine-getunede model verwerkt de stijl en structuur betrouwbaar, terwijl RAG de kennis levert. Deze combinatie presteert beter dan elke afzonderlijke aanpak voor bedrijfstoepassingen met hoge inzet.
Beslissingsstroomschema
Volg deze beslisroute: Gaat het probleem over consistentie van stijl of indeling? → Overweeg fine-tuning. Is de informatie privé of wordt deze vaak bijgewerkt? → Gebruik RAG. Heb je bronverwijzingen nodig? → Gebruik RAG. Is de gegevensset te klein voor fine-tuning (minder dan 500 voorbeelden)? → Gebruik RAG met few-shot prompting. Moet het model een taak uitvoeren die het momenteel weigert uit te voeren? → Fine-tune met RLHF of DPO. Begin bij twijfel met RAG — het is sneller te bouwen, eenvoudiger bij te werken en transparanter.
Voorbeelden van praktijkscenario's
Gebruik deze scenario's om inzicht op te bouwen: interne HR-chatbot (beleid verandert elk kwartaal, bronverwijzingen zijn vereist) → RAG. Codeaanvulling voor een propriëtair framework (consistente codestijl, patronen van het framework) → fine-tuning. Vraag-en-antwoord over juridische documenten (privédocumenten, nauwkeurige bronverwijzing vereist) → RAG. Klantenservicebot (specifieke toon, product-FAQ verandert wekelijks) → fine-tuning voor de toon + RAG voor de kennis. Samensteller van samenvattingen van medische literatuur (actueel onderzoek, toeschrijving is cruciaal) → RAG.
Korte controle
Test je begrip van de concepten uit AI Engineering in deze les.
Samenvatting van de les
In deze les heb je geleerd dat fine-tuning het gedrag en de stijl van een model verandert, maar feitelijke kennis niet betrouwbaar bijwerkt, dat RAG dynamisch kennis aanlevert tijdens inferentie met volledige transparantie en bronverwijzingen, en wat het besliskader is om te kiezen — gebruik RAG voor regelmatig bijgewerkte privékennis waarvoor bronvermelding nodig is, gebruik fine-tuning voor een consistente stijl en indeling, en combineer beide voor bedrijfstoepassingen met hoge inzet. Hierna beginnen we met het bouwen van een volledige RAG-pipeline vanaf nul.
Leer Python met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 30
- Lessen
- 120
Veelgestelde vragen
Is de les “RAG versus fine-tuning: wanneer gebruikt u welke aanpak?” gratis?
Ja — de volledige tekst van “RAG versus fine-tuning: wanneer gebruikt u welke aanpak?” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus AI Engineering Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus AI Engineering Academy bevat in totaal 4 lessen.
Wat leer ik in “RAG versus fine-tuning: wanneer gebruikt u welke aanpak?”?
U vergelijkt RAG en fine-tuning op het gebied van actualiteit van kennis, kosten, latency en implementatiecomplexiteit om te bepalen welke aanpak geschikt is voor verschillende praktijkscenario's. Je oefent met AI Engineering Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met AI Engineering Academy te beginnen?
Ervaring vooraf is niet nodig. AI Engineering Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 4.
Hoe lang duurt de les “RAG versus fine-tuning: wanneer gebruikt u welke aanpak?”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over AI Engineering Academy?
Ja. Elke les over AI Engineering Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Het probleem dat RAG oplost
- De RAG-architectuur: indexeren en ophalen
- De augmented prompt opstellen
- RAG versus fine-tuning: wanneer gebruikt u welke aanpak?