Promptteknik til AI · Lektion

Validering med self-critique

Modelkontrollerede outputs.

Lektion 4 af 413 trin

Validering med self-critique er en gratis Promptteknik til AI-lektion på CoddyKit. Dette er lektion 4 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Promptteknik til AI, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Promptteknik til AI-kurset indeholder 4 lektioner i alt.

Modellen som sin egen kritiker

Selvkritik bruger en LLM til at evaluere en LLM's uddata i forhold til et vurderingsskema eller en politik. Den opdager nuancerede fejl, som deterministiske validatorer ikke kan udtrykke: faktuelle uoverensstemmelser, tone, hjælpsomhed og subtile overtrædelser af politikker.

Det er det modelbaserede supplement til skema- og regelvalidatorer.

Adskil kritikeren fra forfatteren

Kør kritikken som et separat kald med sin egen prompt, ikke som en afsluttende instruktion i genereringen. En kritiker med ren kontekst, der kun bliver bedt om at bedømme, er langt mere pålidelig end at bede forfatteren om at bedømme sig selv midt i genereringen, hvor den er forudindtaget til fordel for sit eget svar.

draft = author_model(task_prompt)
verdict = critic_model(
  'You are a strict reviewer. Judge ONLY the answer below against the rubric.\n'
  'Rubric: ' + rubric + '\nAnswer: ' + draft
)

Struktureret kritikoutput

Få kritikeren til at udsende strukturerede vurderinger, så behandlingskæden kan handle programmatisk. En kritik i fritekst kan ikke behandles automatisk.

CRITIC_SCHEMA = {
  'type': 'object',
  'properties': {
    'pass': {'type': 'boolean'},
    'violations': {'type': 'array', 'items': {'type': 'string'}},
    'severity': {'type': 'string', 'enum': ['none','minor','major','critical']},
    'fix_hint': {'type': 'string'}
  },
  'required': ['pass','violations','severity','fix_hint'],
  'additionalProperties': False
}

Sløjfe med kritik efterfulgt af revision

Kombinér kritikeren med en reviderende model. Kritikeren finder problemerne, forfatteren reviderer ved hjælp af kritikken, og processen gentages, indtil svaret godkendes, eller budgettet er brugt op. Det er den modelbaserede pendant til reparationssløjfen.

draft = author_model(task)
for _ in range(2):
    c = critic_model(draft)
    if c['pass']:
        break
    draft = author_model(task + '\nRevise to fix: ' + c['fix_hint'])
final = draft

Vurderingskriterier gør kritikken pålidelig

En vag instruktion ('er dette godt?') giver støjende vurderinger. Et konkret vurderingsskema med eksplicitte, kontrollerbare kriterier giver ensartede vurderinger. Opdel det i ja/nej-spørgsmål, som kritikeren besvarer enkeltvis.

RUBRIC = [
  'Does the answer directly address the user question?',
  'Are all factual claims supported by the provided context?',
  'Is any disallowed content present?',
  'Is the response within the requested length?'
]

Forankret kritik af faktuel korrekthed

Ved hallucinationsregistrering skal du give kritikeren kildekonteksten og bede den markere enhver påstand, der ikke kan udledes af den. Det omdanner selvkritik til en konsekvenskontrol, som er langt stærkere end at spørge »er dette sandt?« uden dokumentation.

verdict = critic_model(
  'For each claim in the ANSWER, state whether the CONTEXT entails it. '
  'Flag any unsupported claim.\nCONTEXT:\n' + ctx + '\nANSWER:\n' + draft
)

Kritikerens fejltilstande

Kritikeren er selv en LLM og kan fejle:

  • Smiger — den godkender ukritisk forfatterens svar.
  • Overdreven kritik — den markerer korrekt output.
  • Fælles blinde vinkler — den samme model overser de samme fejl.

Modvirk dette ved at bruge en anden modelfamilie som kritiker, en streng reviewerrolle og kalibrerede tærskler.

Brug en billigere eller anderledes kritiker

Kritikeren behøver ikke være den dyreste model. Ofte er en mindre model med et stramt vurderingsskema en omkostningseffektiv kontrol, og brugen af en anden modelfamilie reducerer korrelerede blinde vinkler. Gem den stærkeste model til forfatningen af svar.

Hvornår skal du stole på modellen, og hvornår skal du verificere

Selvkritik reducerer fejl, men er ikke et bevis. For indhold med lav risiko er én kritikrunde tilstrækkelig. For uddata med høj risiko skal du kombinere selvkritik med deterministiske validatorer og menneskelig gennemgang; lad aldrig en model være den eneste afgører af sikkerhedskritiske beslutninger.

Omkostninger, svartid og caching

Selvkritik fordobler omtrent antallet af kald pr. forespørgsel. Styr det ved at lade deterministiske kontroller afgøre, om kritikken skal køres (kritikér kun det, der bestod skema- og regelkontrollerne), cache kritik af identiske udkast, og begræns antallet af revisionsrunder. Kør om muligt kritikken parallelt med arbejde, der ikke blokerer.

if deterministic_ok(draft):
    verdict = critic_model(draft)   # only spend critique on viable drafts

Kalibrér mod menneskelige mærkater

Validér kritikeren, før du stoler på den. Opbyg et sæt menneskemærkede uddata, kør kritikeren, og mål overensstemmelsen (præcision og genkaldelse i forhold til menneskers vurderinger). Justér vurderingsskemaet og rollen, indtil kritikerens vurderinger korrelerer med menneskers; kontrollér igen efter opgraderinger af modellen.

agreement = mean(critic(d)['pass'] == human_label[d] for d in eval_set)
assert agreement > 0.9

Hurtigt tjek

Du vil have kritikeren til pålideligt at opdage hallucinationer i et RAG-svar. Hvad forbedrer pålideligheden mest?

Opsummering

Validering med selvkritik:

  • En separat kritiker med ren kontekst bedømmer forfatterens uddata.
  • Udsend strukturerede vurderinger, og driv en sløjfe med kritik efterfulgt af revision.
  • Konkrete vurderingsskemaer og forankrede konsekvenskontroller øger pålideligheden.
  • Vær opmærksom på smiger og fælles blinde vinkler; brug en anden kritikermodel.
  • Styr efter omkostninger, kombinér med deterministiske kontroller, og kalibrér mod mennesker.

Du har gennemført afsnittet om sikkerhedsforanstaltninger. Næste kursus: red teaming og modstanderbaseret evaluering.

Gratis at komme i gang

Lær Promptteknik til AI med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
53
Lektioner
199

Ofte stillede spørgsmål

Er lektionen “Validering med self-critique” gratis?

Ja — alle 3 lektioner i læringssporet Promptteknik til AI, inklusive “Validering med self-critique”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Promptteknik til AI-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Validering med self-critique”?

Modelkontrollerede outputs. Du øver dig i Promptteknik til AI med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Promptteknik til AI?

Der kræves ingen tidligere erfaring. Promptteknik til AI på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 4 af 4.

Hvor lang tid tager lektionen “Validering med self-critique”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Promptteknik til AI-lektion?

Ja. Alle Promptteknik til AI-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Hvad er guardrails
  2. Filtrering af input og output
  3. Schema- og regelvalidatorer
  4. Validering med self-critique
← Tilbage til Promptteknik til AI