Problemet RAG løser
Undersøk reelle tilfeller der LLM-er hallusinerer utdatert eller feilaktig informasjon, og forstå hvordan forankring av svar i uthentede dokumenter løser disse problemene.
Problemet RAG løser er en gratis leksjon i AI Engineering Academy på CoddyKit. Dette er leksjon 1 av 4. Du kan lese hele leksjonen gratis nedenfor – og deretter øve praktisk i nettleseren med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i AI Engineering Academy, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i AI Engineering Academy inneholder totalt 4 leksjoner.
LLM-er har en kunnskapsgrense
Alle store språkmodeller trenes på et øyeblikksbilde av internett frem til en bestemt dato, kalt kunnskapsgrensen. GPT-4o har en kunnskapsgrense tidlig i 2024. Spør De om hendelser som skjedde etter denne datoen, vil modellen enten innrømme at den ikke vet, eller enda verre: selvsikkert dikte opp informasjon som høres plausibel ut, men er feil. For applikasjoner som trenger aktuell eller proprietær kunnskap, er dette et grunnleggende problem.
Hallusinasjonsproblemet
Hallusinasjon oppstår når en LLM genererer tekst som høres autoritativ ut, men som er faktisk feil. Modeller trenes til å produsere flytende og sammenhengende tekst – de trenes ikke eksplisitt til å avstå fra å svare når de ikke vet noe. Derfor fyller de kunnskapshull med plausible gjetninger. Studier viser at selv de beste modellene hallusinerer i kunnskapsintensive oppgaver 10–40 % av tiden uten ekstern forankring.
Et konkret eksempel på en hallusinasjon
Tenk Dem at De spør en LLM: Hva er vilkårene i leverandørkontrakten for tredje kvartal 2025 i virksomheten vår? Modellen har aldri sett det interne dokumentet Deres. I stedet for å si at den ikke vet, kan den generere et plausibelt kontraktsammendrag ved hjelp av generisk juridisk språk. Hvis en ansatt handler på grunnlag av denne oppdiktede informasjonen, kan konsekvensene bli alvorlige. Dette er nettopp den typen feil RAG ble utviklet for å forhindre.
# Without RAG — LLM guesses from parametric memory
response = client.chat.completions.create(
model='gpt-4o',
messages=[
{'role': 'user',
'content': 'What are our Q3 2025 vendor contract terms?'}
]
)
# Model has no access to your documents — may hallucinate
print(response.choices[0].message.content)Forankring løser hallusinasjoner
Innsikten bak RAG er enkel: Hvis De gir modellen den relevante informasjonen i selve prompten, trenger den ikke å stole på memorert kunnskap. Modellen går fra å generere fra hukommelsen til å lese fra konteksten. Slik fungerer mennesker også – når De trenger nøyaktige detaljer, slår De dem opp i stedet for å stole på hukommelsen. RAG setter den samme arbeidsflyten i system for LLM-er.
# With RAG — answer grounded in retrieved documents
context = retrieve_relevant_chunks(query='Q3 2025 vendor contract terms')
response = client.chat.completions.create(
model='gpt-4o',
messages=[
{'role': 'system', 'content': 'Answer using only the provided context.'},
{'role': 'user', 'content': f'Context: {context}\n\nQuestion: What are our Q3 2025 vendor contract terms?'}
]
)Statisk finjustering hjelper ikke her
En vanlig misforståelse er at fine-tuning av modellen på dokumentene dine løser hallusinering. Fine-tuning oppdaterer modellens vekter for å forbedre stil, format og oppgaveetterlevelse, men tilfører ikke pålitelig faktakunnskap. Studier viser at fine-tunede modeller fortsatt hallusinerer på selve treningsdataene. Kunnskap må gis ved inferenstidspunktet via kontekstvinduet for å kunne gjengis pålitelig.
RAG muliggjør kunnskap i sanntid
Fordi RAG henter informasjon fra et oppdatert dokumentlager, håndterer det naturlig kunnskap som endrer seg over tid. Når policydokumentet oppdateres, indekserer du det på nytt, og alle påfølgende spørringer bruker umiddelbart den nye versjonen – uten at modellen må trenes på nytt. Dette gjør RAG langt mer praktisk enn periodisk fine-tuning for bruksområder som interne kunnskapsbaser, kundestøttesystemer og verktøy for finansiell analyse.
RAG fungerer på private, proprietære data
De fleste virksomhetsdata kan ikke sendes til OpenAI for trening på grunn av krav til personvern og etterlevelse. RAG omgår dette: De sensitive dokumentene dine forblir i din egen vektordatabase, og bare de relevante delene sendes til LLM-en for hver spørring. Du kan til og med kjøre en lokal LLM som Llama 3, slik at alle data forblir lokalt. RAG er det primære mønsteret for å bygge KI på konfidensielt virksomhetsinnhold.
RAG muliggjør kildehenvisninger
Når en LLM genererer svar fra hukommelsen, finnes det ingen kilde å henvise til. Når den genererer svar fra hentede dokumenter, kan den henvise til de nøyaktige kildene. Du kan instruere modellen til å inkludere dokumentnavn og sidetall i svaret, slik at brukerne kan klikke seg videre og kontrollere originalen. Kildehenvisninger øker tilliten til KI-genererte svar betydelig, noe som er avgjørende i juridiske, medisinske og finansielle bruksområder.
system_prompt = '''You are a helpful assistant.
Answer questions using ONLY the provided context.
At the end of your answer, list the sources you used
in this format: [Source: document_name, page X]
If the context does not contain the answer, say:
"I don't have that information in the provided documents."'''Mønsteret hent–generer
RAG følger et totrinnsmønster ved inferenstidspunktet: Retrieve – konverter brukerens spørsmål til en embedding, søk i vektorlageret etter de mest relevante dokumentdelene, og hent de K beste resultatene. Generate – bygg en prompt som inkluderer de hentede delene som kontekst, og be LLM-en svare på spørsmålet utelukkende basert på denne konteksten. LLM-en leser, sammenfatter og svarer.
def answer_with_rag(user_question, vector_store, llm_client):
# Step 1: Retrieve
query_embedding = embed(user_question)
chunks = vector_store.search(query_embedding, top_k=5)
context = '\n\n'.join([c['text'] for c in chunks])
# Step 2: Generate
response = llm_client.chat.completions.create(
model='gpt-4o',
messages=[
{'role': 'system', 'content': f'Answer using only:\n{context}'},
{'role': 'user', 'content': user_question}
]
)
return response.choices[0].message.contentHva RAG ikke løser
RAG er kraftig, men ingen universalløsning. Det fungerer fortsatt dårlig når: svaret krever sammenstilling på tvers av hundrevis av dokumenter (hentingen returnerer bare noen få deler), spørsmålet i seg selv er multi-hop og modellen må resonnere gjennom mellomliggende trinn, eller de hentede delene er misvisende eller motstridende. Når du forstår disse begrensningene, blir det lettere å utforme hybridsystemer som kombinerer RAG med resonnerende agenter.
RAG sammenlignet med alternativene
Du har tre hovedalternativer for å gi en LLM domenekunnskap: prompt stuffing (legg alt i prompten – fungerer bare for svært små tekstsamlinger), fine-tuning (lærer modellen stil og format godt, men er ikke pålitelig for faktagjenfinning), og RAG (henter relevante fakta dynamisk ved inferenstidspunktet og skalerer til millioner av dokumenter). For de fleste produksjonsbruksområder som krever oppdatert, privat eller storskala kunnskap, er RAG det riktige valget.
Hurtigsjekk
Test forståelsen din av konsepter innen KI-teknikk fra denne leksjonen.
Oppsummering av leksjonen
I denne leksjonen lærte du: hvorfor LLM-er hallusinerer på grunn av kunnskapsavgrensninger og manglende evne til å si «Jeg vet ikke», hvorfor fine-tuning ikke løser hallusinering når det gjelder faktagjenfinning, og hvordan RAG forankrer svar i hentede dokumenter og muliggjør kildehenvisninger, kunnskap i sanntid og trygg bruk av private data. Neste gang ser vi på hele RAG-arkitekturen, inkludert indekserings- og hentefasene.
Lær deg Python med en AI-veileder – gratis
Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.
- Kurs
- 30
- Leksjoner
- 120
Ofte stilte spørsmål
Er leksjonen «Problemet RAG løser» gratis?
Ja – hele teksten i «Problemet RAG løser» er gratis å lese her på nettet. For å øve interaktivt med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt, og for å låse opp resten av AI Engineering Academy-kurset, kan du oppgradere til CoddyKit PRO. Kurset i AI Engineering Academy inneholder totalt 4 leksjoner.
Hva lærer jeg i «Problemet RAG løser»?
Undersøk reelle tilfeller der LLM-er hallusinerer utdatert eller feilaktig informasjon, og forstå hvordan forankring av svar i uthentede dokumenter løser disse problemene. Du øver på AI Engineering Academy med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.
Trenger jeg erfaring for å begynne med AI Engineering Academy?
Ingen tidligere erfaring er nødvendig. AI Engineering Academy på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 1 av 4.
Hvor lang tid tar leksjonen «Problemet RAG løser»?
De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.
Kan jeg skrive og kjøre kode i denne AI Engineering Academy-leksjonen?
Ja. Alle AI Engineering Academy-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.
Alle leksjonene i dette kurset
- Problemet RAG løser
- RAG-arkitekturen: indeksering og uthenting
- Utforme den utvidede prompten
- RAG versus finjustering: når bør De bruke hva?