LLM-applikationer i produktion (RAG + vektordatabase + caching) · Lektion

Nøgletal for RAG-ydeevne

Forstå og anvend relevante måltal som precision, recall, kontekstuel relevans og faithfulnes til at evaluere RAG-output.

Lektion 1 af 411 trin

Nøgletal for RAG-ydeevne er en gratis LLM-applikationer i produktion (RAG + vektordatabase + caching)-lektion på CoddyKit. Dette er lektion 1 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i LLM-applikationer i produktion (RAG + vektordatabase + caching), og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. LLM-applikationer i produktion (RAG + vektordatabase + caching)-kurset indeholder 4 lektioner i alt.

Hvorfor evaluere RAG-ydeevne?

Når du bygger Retrieval Augmented Generation-systemer (RAG), er det ikke nok bare at implementere dem. Vi er nødt til at vide, om de faktisk fungerer godt!

Evaluering af RAG er mere kompleks end evaluering af en selvstændig stor sprogmodel (LLM), fordi den omfatter to hovedfaser: informationssøgning og generering.

RAG's særlige evalueringsbehov

Traditionelle evalueringsmålinger for LLM-modeller fokuserer ofte på kvaliteten af den genererede tekst, f.eks. sproglig flydende formulering eller sammenhæng. Men RAG-systemer har specifikke mål:

  • At give faktabaserede svar.
  • At undgå 'hallucinationer' (at opfinde oplysninger).
  • Kun at bruge relevante oplysninger fra dine data.

Det kræver et særligt sæt målinger.

Forklaring af kontekstuel relevans

Den første vigtige måling er kontekstuel relevans.

  • Den måler, hvor relevante de hentede dokumenter eller den 'kontekst', der blev hentet, er for brugerens oprindelige spørgsmål.
  • Hvis informationssøgeren henter irrelevante oplysninger, har LLM-modellen ikke et godt grundlag at arbejde med, hvilket fører til dårlige svar.

Høj kontekstuel relevans betyder, at din informationssøger udfører sit arbejde godt!

Kontekstuel relevans: Et eksempel

Lad os sige, at en bruger spørger: "Hvad er fordelene ved at spise æbler?"

God kontekst: "Æbler er rige på fibre, C-vitamin og antioxidanter ..." (Høj relevans)

Dårlig kontekst: "Appelsiner er citrusfrugter. Æbler kan være grønne eller røde ..." (Lav relevans for 'fordele')

Kvaliteten af den hentede kontekst påvirker direkte LLM-modellens evne til at svare korrekt.

Troskab: Hold dig til fakta

Dernæst har vi troskab (også kaldet 'forankring').

  • Denne måling kontrollerer, om LLM-modellens genererede svar fuldt ud understøttes af den hentede kontekst.
  • Det er afgørende for at forhindre 'hallucinationer' – hvor LLM-modellen opfinder fakta, der ikke findes i kildematerialet.

Et troværdigt RAG-system giver kun oplysninger, som det kan verificere i sine kilder.

Troskab: Et eksempel

Brugerspørgsmål: "Hvad er hovedstaden i Frankrig?"

Hentet kontekst: "Paris er hovedstaden i Frankrig, kendt for Eiffeltårnet."

Trofærdigt svar: "Hovedstaden i Frankrig er Paris." (Understøttes af konteksten)

Utroværdigt svar: "Hovedstaden i Frankrig er Lyon, en smuk by." (Understøttes ikke af konteksten)

Svarrelevans: Blev der svaret?

Svarrelevans evaluerer, om LLM-modellens genererede svar direkte besvarer brugerens oprindelige spørgsmål.

  • Selv hvis svaret er troværdigt og baseret på relevant kontekst, kan det stadig være for omstændeligt, komme på et sidespor eller ramme ved siden af spørgsmålet.
  • Denne måling sikrer, at det endelige output er nyttigt og præcist for brugeren.

Svarrelevans: Et eksempel

Brugerspørgsmål: "Hvornår blev internettet opfundet?"

Hentet kontekst: "Internettets oprindelse kan spores tilbage til 1960'erne med ARPANET ..."

Relevant svar: "Internettets oprindelse kan spores tilbage til 1960'erne med ARPANET."

Irrelevant svar: "Internettet er et globalt netværk af computere. Det har revolutioneret kommunikationen." (Besvarer ikke 'hvornår')

Præcision og genkaldelse ved informationssøgning

Mens de tidligere målinger evaluerer RAG-systemet som helhed, er klassiske målinger fra informationssøgning (IR) som præcision og genkaldelse afgørende for komponenten til informationssøgning.

  • Præcision: Hvor stor en procentdel af de hentede dokumenter er faktisk relevante? (Minimér irrelevante dokumenter)
  • Genkaldelse: Hvor stor en procentdel af alle reelt relevante dokumenter blev faktisk hentet? (Minimér oversete relevante dokumenter)

Det er afgørende at afbalancere disse to for at give LLM-modellen den bedst mulige kontekst.

Test din viden!

Et RAG-system henter dokumenter og genererer derefter et svar. Overvej følgende scenarie:

Brugerspørgsmål: "Hvad er den typiske levetid for en huskat?"

Hentet kontekst: "Huskatte lever normalt i 12 til 18 år. Nogle kan leve længere."

LLM-svar: "Katte er pelsede dyr, der nyder at sove og lege. Deres levetid varierer."

Opsummering: Vigtige RAG-målinger

Tillykke! Du har lært om de vigtigste målinger til evaluering af RAG-systemer:

  • Kontekstuel relevans: Hvor god er den hentede information?
  • Troskab: Er svaret i overensstemmelse med den hentede kontekst?
  • Svarrelevans: Besvarer svaret brugerens spørgsmål?
  • Præcision og genkaldelse: Hvor effektiv er informationssøgningskomponenten?

Når du behersker disse, kan du bygge mere nøjagtige, pålidelige og nyttige RAG-applikationer.

Gratis at komme i gang

Lær LLM-applikationer i produktion (RAG + vektordatabase + caching) med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
12
Lektioner
48

Ofte stillede spørgsmål

Er lektionen “Nøgletal for RAG-ydeevne” gratis?

Ja — hele teksten til “Nøgletal for RAG-ydeevne” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af LLM-applikationer i produktion (RAG + vektordatabase + caching)-kurset, skal du opgradere til CoddyKit PRO. LLM-applikationer i produktion (RAG + vektordatabase + caching)-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Nøgletal for RAG-ydeevne”?

Forstå og anvend relevante måltal som precision, recall, kontekstuel relevans og faithfulnes til at evaluere RAG-output. Du øver dig i LLM-applikationer i produktion (RAG + vektordatabase + caching) med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på LLM-applikationer i produktion (RAG + vektordatabase + caching)?

Der kræves ingen tidligere erfaring. LLM-applikationer i produktion (RAG + vektordatabase + caching) på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 1 af 4.

Hvor lang tid tager lektionen “Nøgletal for RAG-ydeevne”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne LLM-applikationer i produktion (RAG + vektordatabase + caching)-lektion?

Ja. Alle LLM-applikationer i produktion (RAG + vektordatabase + caching)-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Nøgletal for RAG-ydeevne
  2. Udvikling af evalueringsbenchmarks
  3. A/B-test og feedbacksløjfer fra brugere
  4. Registrering og måling af hallucinationer
← Tilbage til LLM-applikationer i produktion (RAG + vektordatabase + caching)