Promptteknik til AI · Lektion

Læsning og evaluering af AI-output

Kriterier til vurdering af relevans, nøjagtighed og fuldstændighed i AI-svar.

Lektion 1 af 413 trin

Læsning og evaluering af AI-output er en gratis Promptteknik til AI-lektion på CoddyKit. Dette er lektion 1 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Promptteknik til AI, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Promptteknik til AI-kurset indeholder 4 lektioner i alt.

Hvorfor evaluering er vigtig

At få et AI-svar er kun halvdelen af arbejdet. Den anden halvdel er at vurdere, om svaret faktisk er godt.

Uden en tydelig evalueringsramme accepterer du måske et svar, der ser gennemarbejdet ud, men besvarer det forkerte spørgsmål. Eller du afviser måske et svar, der faktisk er nyttigt, fordi det ikke er formateret på den måde, du forventede.

At udvikle et sikkert blik for kvaliteten af AI-genereret indhold er en af de mest praktiske færdigheder inden for promptudvikling.

De fire evalueringskriterier

Når du læser et AI-svar, skal du vurdere det ud fra fire dimensioner:

  • Relevans — Besvarede det det faktiske spørgsmål, du stillede?
  • Nøjagtighed — Er oplysningerne faktuelt korrekte?
  • Fuldstændighed — Dækkede det alle dele af anmodningen?
  • Format — Er det struktureret på den måde, du har brug for?

Et svar kan få en høj vurdering på tre områder og ikke leve op til det fjerde. Hvert kriterium er vigtigt i sig selv.

Kriterium 1: Relevans

Relevans handler om, hvorvidt modellen besvarede det spørgsmål, du faktisk stillede, eller om den besvarede et beslægtet, men anderledes spørgsmål.

Eksempel: Du spørger "Hvilke risici er der ved at bruge LLM'er i sundhedsvæsenet?", og modellen svarer med en generel gennemgang af, hvordan LLM'er fungerer. Svaret kan være korrekt, men det er ikke relevant – det rammer ved siden af.

Du kan kontrollere relevansen ved at læse din oprindelige prompt igen og spørge dig selv: Adresserer svaret direkte det, jeg spurgte om?

Kriterium 2: Nøjagtighed

Nøjagtighed handler om, hvorvidt fakta, tal og påstande i svaret er korrekte.

AI-modeller kan hallucinere – de kan fremsætte påstande med stor sikkerhed, som ganske enkelt er forkerte. Almindelige problemer med nøjagtighed omfatter:

  • Forkerte statistikker eller datoer
  • Citater, der er tillagt den forkerte person
  • Forældede oplysninger, der præsenteres som aktuelle
  • Opdigtede henvisninger eller kildeangivelser

Ved faktuelle emner bør du altid kontrollere vigtige påstande med en pålidelig kilde, før du bruger resultatet.

Kriterium 3: Fuldstændighed

Fuldstændighed handler om, hvorvidt svaret dækkede alle dele af din anmodning.

Hvis din prompt havde flere dele – "Forklar X, angiv tre eksempler, og foreslå et næste skridt" – skal du kontrollere, at modellen behandlede alle tre dele og ikke kun den første.

Modeller springer nogle gange den sidste del af en anmodning med flere dele over, især hvis prompten er lang. Den mest pålidelige måde at kontrollere fuldstændigheden på er at sammenholde svaret med din prompt punkt for punkt.

Kriterium 4: Format

Format handler om, hvorvidt svaret er struktureret på den måde, du har brug for.

Selv et helt korrekt og fuldstændigt svar kan være svært at bruge, hvis formatet er forkert. Almindelige formatproblemer er:

  • Løbende tekst, når du havde brug for punktform
  • Et langt essay, når du havde brug for et resumé
  • Manglende overskrifter, der kunne gøre det lettere at finde rundt
  • Kode uden forklaringer eller forklaringer uden kode

Formatproblemer er ofte de letteste at løse med en opfølgende prompt.

En enkel evalueringsliste

Efter at have modtaget et AI-svar kan du gennemgå denne mentale tjekliste:

  • Relevans: Besvarer det mit faktiske spørgsmål?
  • Nøjagtighed: Kan jeg stole på faktaene? Hvad skal jeg kontrollere?
  • Fuldstændighed: Dækkede det alle dele af min anmodning?
  • Format: Er det struktureret på en måde, jeg kan bruge?

Hvis et kriterium ikke er opfyldt, fortæller det dig præcis, hvilken type opfølgende prompt du skal skrive. Hvert kriterium peger på en bestemt type korrektion.

Evaluering i kode: Scoring af et svar

Du kan bygge en let evalueringsindpakning i Python, der scorer et svar på hvert kriterium ved hjælp af et ekstra LLM-kald:

import openai

client = openai.OpenAI(api_key='sk-...')

def evaluate_response(original_prompt, response_text):
    eval_prompt = f'''You are an evaluator. Score the following AI response on a scale of 1-5 for each criterion.

Original prompt: {original_prompt}

AI response: {response_text}

Score each:
- Relevance (1-5): Did it answer the actual question?
- Accuracy (1-5): Are the facts correct? (flag any concerns)
- Completeness (1-5): Did it cover all parts of the request?
- Format (1-5): Is it structured appropriately?

Return your scores as: Relevance: X, Accuracy: X, Completeness: X, Format: X
Then a one-sentence note for any score below 4.'''

    result = client.chat.completions.create(
        model='gpt-4o-mini',
        messages=[{'role': 'user', 'content': eval_prompt}]
    )
    return result.choices[0].message.content

Relevansproblemer: Almindelige mønstre

Problemer med relevansen følger ofte forudsigelige mønstre. Hvis du genkender dem, går evalueringen hurtigere:

  • Emneskred – Modellen starter korrekt, men bevæger sig derefter over på et beslægtet emne
  • Spørgsmålsudskiftning – Modellen besvarer en enklere eller lettere version af dit spørgsmål
  • Overgeneralisering – Du spurgte om et specifikt tilfælde, men modellen besvarer det generelle tilfælde
  • Ignorering af begrænsninger – Du angav en kontekst, f.eks. "for begyndere", men modellen ignorerede den

Hvert mønster peger på en bestemt løsning, som du kan skrive i din opfølgende prompt.

Advarselstegn på manglende nøjagtighed

Selv når du ikke kan kontrollere en påstand med det samme, er der bestemte signaler, der tyder på lavere nøjagtighed:

  • Meget specifikke tal uden en kilde
  • Påstande, der virker for belejlige eller rammer helt perfekt
  • Henvisninger til undersøgelser, artikler eller bøger med titel og forfatter
  • Datoer og versionsnumre, som ændrer sig ofte
  • Specifikke juridiske, medicinske eller økonomiske oplysninger

Det er ikke beviser på fejl, men det er oplysninger, som er værd at kontrollere en ekstra gang, før du bruger resultatet i en situation med store konsekvenser.

Brug evaluering til at skrive bedre opfølgende prompter

Den egentlige værdi ved evaluering er, at hvert kriterium, der ikke er opfyldt, direkte peger på en bestemt type opfølgende prompt:

  • Manglende relevans → "Du svarede på X, men jeg spurgte om Y. Fokuser venligst på Y."
  • Bekymring om nøjagtighed → "Kontrollér venligst påstanden om Z igen, og angiv grundlaget for den."
  • Manglende fuldstændighed → "Du behandlede ikke den tredje del af mit spørgsmål. Tilføj venligst den del."
  • Forkert format → "Skriv dette om som en punktliste med et resumé på én linje øverst."

Evaluering og opfølgende prompting fungerer som en feedbacksløjfe.

Videnscheck: Evalueringskriterier

Du beder modellen om: "Angiv de 5 bedste Python-webframeworks med en beskrivelse på én sætning af hvert." Modellen svarer med et velskrevet essay om Pythons historie og fremgang inden for webudvikling. Den nævner kort Flask og Django, men angiver ikke 5 frameworks.

Hvilket kriterium overtræder dette svar mest alvorligt?

Opsummering: Læsning og evaluering af AI-resultater

God prompting er en proces i to trin: at udforme prompten og at evaluere svaret.

De fire kriterier – Relevans, Nøjagtighed, Fuldstændighed, Format – giver dig en systematisk måde at vurdere alle AI-resultater på. Hvert kriterium, der ikke er opfyldt, fortæller dig præcis, hvilken type opfølgende prompt du skal skrive.

I næste lektion skal du øve dig i at skrive disse opfølgende prompter for at rette bestemte typer problemer.

Gratis at komme i gang

Lær Promptteknik til AI med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
53
Lektioner
199

Ofte stillede spørgsmål

Er lektionen “Læsning og evaluering af AI-output” gratis?

Ja — alle 3 lektioner i læringssporet Promptteknik til AI, inklusive “Læsning og evaluering af AI-output”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Promptteknik til AI-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Læsning og evaluering af AI-output”?

Kriterier til vurdering af relevans, nøjagtighed og fuldstændighed i AI-svar. Du øver dig i Promptteknik til AI med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Promptteknik til AI?

Der kræves ingen tidligere erfaring. Promptteknik til AI på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 1 af 4.

Hvor lang tid tager lektionen “Læsning og evaluering af AI-output”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Promptteknik til AI-lektion?

Ja. Alle Promptteknik til AI-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Læsning og evaluering af AI-output
  2. Skriv effektive opfølgende prompts
  3. Byg videre på tidligere svar
  4. Hvornår De bør forfine eller begynde forfra
← Tilbage til Promptteknik til AI