LangChain / RAG / vectordatabases · Les

Prestaties van RAG-systemen evalueren

Leer metrics en technieken om de nauwkeurigheid, relevantie en samenhang van de reacties van uw RAG-applicatie te beoordelen.

Les 3 van 411 stappen

Prestaties van RAG-systemen evalueren is een gratis LangChain / RAG / vectordatabases-les op CoddyKit. Dit is les 3 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject LangChain / RAG / vectordatabases. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus LangChain / RAG / vectordatabases bevat in totaal 4 lessen.

Waarom RAG-systemen evalueren?

Wanneer je een Retrieval Augmented Generation (RAG)-toepassing bouwt, is het cruciaal om te weten of deze werkt zoals bedoeld. Met evaluatie kun je nagaan of je systeem nauwkeurige, relevante en nuttige antwoorden geeft.

Zonder een goede evaluatie is het moeilijk vast te stellen of wijzigingen aan je RAG-pijplijn (zoals nieuwe inbeddingsmodellen of strategieën voor het opdelen in stukken) deze daadwerkelijk beter of slechter maken.

Belangrijke aspecten van RAG-evaluatie

Bij het evalueren van een RAG-systeem kijken we naar verschillende aspecten. Over het algemeen richten we ons op:

  • Ophaalkwaliteit: worden de juiste documenten gevonden?
  • Generatiekwaliteit: produceert de LLM goede antwoorden op basis van die documenten?

Deze twee onderdelen worden vaak afzonderlijk en vervolgens samen geëvalueerd om een volledig beeld te krijgen.

Het belang van de referentiewaarheid

Om effectief te evalueren, vooral met geautomatiseerde meetwaarden, heb je een gegevensset met een 'referentiewaarheid' nodig. Dit betekent dat je het volgende hebt:

  • Een reeks vragen van gebruikers.
  • De werkelijk relevante documenten voor elke vraag.
  • Het ideale, juiste antwoord op elke vraag.

Met deze referentiegegevens kun je de uitvoer van je RAG-systeem vergelijken met wat als correct wordt beschouwd.

Ophaalmeetwaarden: precisie en volledigheid

Voor de ophaalcomponent gebruiken we vaak meetwaarden zoals precisie en volledigheid.

  • Precisie: hoeveel van alle opgehaalde documenten waren daadwerkelijk relevant? Een hoge precisie betekent minder irrelevante documenten.
  • Volledigheid: hoeveel van alle werkelijk relevante documenten wist ons systeem op te halen? Een hoge volledigheid betekent dat er minder relevante documenten worden gemist.

Deze meetwaarden helpen ons te beoordelen hoe goed het zoeken naar documenten werkt.

Code: ophaalmeetwaarden berekenen

Dit Python-fragment laat zien hoe je precisie en volledigheid berekent voor een nagebootst ophaalscenario. relevant_docs bevat de 'referentiewaarheid' en retrieved_docs bevat wat ons systeem heeft gevonden.

def evaluate_retrieval(relevant_docs, retrieved_docs):
    true_positives = len(relevant_docs.intersection(retrieved_docs))

    precision = true_positives / len(retrieved_docs) if len(retrieved_docs) > 0 else 0
    recall = true_positives / len(relevant_docs) if len(relevant_docs) > 0 else 0

    print(f"Precision: {precision:.2f}")
    print(f"Recall: {recall:.2f}")

if __name__ == "__main__":
    # Example 1: Perfect retrieval
    relevant_set_1 = {"docA", "docB", "docC"}
    retrieved_set_1 = {"docA", "docB", "docC"}
    print("--- Example 1: Perfect Retrieval ---")
    evaluate_retrieval(relevant_set_1, retrieved_set_1)

    # Example 2: Some missing, some irrelevant
    relevant_set_2 = {"docX", "docY", "docZ"}
    retrieved_set_2 = {"docX", "docA", "docY"}
    print("\n--- Example 2: Mixed Retrieval ---")
    evaluate_retrieval(relevant_set_2, retrieved_set_2)

Generatiemetrieken: getrouwheid

Voor het gegenereerde antwoord is getrouwheid (ook wel 'feitelijkheid' genoemd) essentieel. Deze metriek meet of het antwoord van het LLM daadwerkelijk wordt ondersteund door de opgehaalde documenten.

Een RAG-systeem mag niet 'hallucineren' of informatie verzinnen. Als een feit niet in de opgehaalde context staat, mag het LLM dit niet in zijn antwoord opnemen.

Generatiemetrieken: relevantie van het antwoord

Met relevantie van het antwoord wordt beoordeeld of het gegenereerde antwoord rechtstreeks ingaat op de oorspronkelijke vraag van de gebruiker. Een antwoord kan wel trouw zijn aan de opgehaalde documenten, maar toch niet relevant zijn als de documenten zelf niet over het juiste onderwerp gingen.

Deze metriek helpt ervoor te zorgen dat het RAG-systeem gericht blijft op de daadwerkelijke informatiebehoefte van de gebruiker.

Menselijke versus geautomatiseerde evaluatie

Hoewel geautomatiseerde metrieken efficiënt zijn, is menselijke evaluatie vaak essentieel voor subjectieve eigenschappen zoals vloeiendheid, toon en genuanceerde relevantie.

  • Geautomatiseerd: snel, schaalbaar en geschikt voor objectieve metrieken (precisie, recall en sommige controles op getrouwheid).
  • Menselijk: de gouden standaard voor subjectieve kwaliteit en cruciaal voor complexe vragen, maar duur en traag.

Een hybride aanpak, waarbij beide methoden worden gebruikt, is vaak het beste voor een uitgebreide evaluatie van RAG.

Hulpmiddelen voor RAG-evaluatie

Verschillende bibliotheken en frameworks helpen om RAG-evaluatie te stroomlijnen:

  • LangChain: biedt ingebouwde evaluatiemodules, waaronder metrieken zonder referentie en integraties met LLM-as-a-judge.
  • Ragas: speciaal ontworpen voor RAG-evaluatie, met metrieken zoals getrouwheid, relevantie van het antwoord, contextprecisie en contextrecall.
  • TruLens: biedt observability en evaluatie voor LLM-toepassingen, waaronder RAG, met diepgaande inzichten in de uitvoering van de keten.

Deze hulpmiddelen automatiseren een groot deel van de berekening en rapportage van metrieken.

Korte controle: RAG-metrieken

Welke van de volgende zijn belangrijke metrieken voor het evalueren van de kwaliteit van het gegenereerde antwoord in een RAG-systeem?

Samenvatting: RAG-prestaties evalueren

We hebben geleerd dat het evalueren van RAG-systemen essentieel is om ervoor te zorgen dat ze accurate en relevante informatie leveren. De belangrijkste punten zijn:

  • De evaluatie omvat zowel retrieval (relevante documenten vinden) als generatie (goede antwoorden maken).
  • Ground-truthgegevens zijn essentieel voor een betrouwbare evaluatie.
  • Metrieken zoals precisie en recall meten de kwaliteit van retrieval.
  • Getrouwheid en relevantie van het antwoord beoordelen de kwaliteit van het gegenereerde antwoord.
  • Een combinatie van geautomatiseerde en menselijke evaluatie levert de meest uitgebreide inzichten op.
  • Hulpmiddelen zoals LangChain, Ragas en TruLens kunnen helpen bij het opzetten van robuuste evaluatiepipelines.
Gratis beginnen

Leer LangChain / RAG / vectordatabases met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
12
Lessen
48

Veelgestelde vragen

Is de les “Prestaties van RAG-systemen evalueren” gratis?

Ja — de volledige tekst van “Prestaties van RAG-systemen evalueren” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus LangChain / RAG / vectordatabases wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus LangChain / RAG / vectordatabases bevat in totaal 4 lessen.

Wat leer ik in “Prestaties van RAG-systemen evalueren”?

Leer metrics en technieken om de nauwkeurigheid, relevantie en samenhang van de reacties van uw RAG-applicatie te beoordelen. Je oefent met LangChain / RAG / vectordatabases door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met LangChain / RAG / vectordatabases te beginnen?

Ervaring vooraf is niet nodig. LangChain / RAG / vectordatabases op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 3 van 4.

Hoe lang duurt de les “Prestaties van RAG-systemen evalueren”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over LangChain / RAG / vectordatabases?

Ja. Elke les over LangChain / RAG / vectordatabases bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Alle RAG-componenten integreren
  2. Query's verwerken en antwoorden genereren
  3. Prestaties van RAG-systemen evalueren
  4. Een golden testset voor RAG bouwen
← Terug naar LangChain / RAG / vectordatabases