AI-prompt engineering · leksjon

Validering med self-critique

Output kontrollert av modellen.

Leksjon 4 av 413 trinn

Validering med self-critique er en gratis leksjon i AI-prompt engineering på CoddyKit. Dette er leksjon 4 av 4. Du kan lese valgfritt 3 leksjoner fra denne læringsstien gratis i sin helhet – deretter låser CoddyKit PRO opp alle leksjoner, samt praktisk øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i AI-prompt engineering, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i AI-prompt engineering inneholder totalt 4 leksjoner.

Modellen som sin egen kritiker

Selvkritikk bruker en LLM til å evaluere utdata fra en LLM mot et vurderingsgrunnlag eller en policy. Den oppdager nyanserte feil som deterministiske validatorer ikke kan uttrykke: faktiske inkonsistenser, tone, hjelpsomhet og subtile policybrudd.

Dette er det modellbaserte supplementet til skjema- og regelvalidatorer.

Skill kritikeren fra forfatteren

Kjør kritikken som et eget kall med sin egen prompt, ikke som en instruks på slutten av genereringen. En kritiker med ren kontekst som bare skal vurdere, er langt mer pålitelig enn å be forfatteren vurdere seg selv midt i genereringen, der den er partisk til fordel for sitt eget svar.

draft = author_model(task_prompt)
verdict = critic_model(
  'You are a strict reviewer. Judge ONLY the answer below against the rubric.\n'
  'Rubric: ' + rubric + '\nAnswer: ' + draft
)

Strukturerte resultater fra kritikken

La kritikeren generere strukturerte avgjørelser slik at pipelinen kan handle programmatisk. En kritikk i fritekst kan ikke behandles maskinelt.

CRITIC_SCHEMA = {
  'type': 'object',
  'properties': {
    'pass': {'type': 'boolean'},
    'violations': {'type': 'array', 'items': {'type': 'string'}},
    'severity': {'type': 'string', 'enum': ['none','minor','major','critical']},
    'fix_hint': {'type': 'string'}
  },
  'required': ['pass','violations','severity','fix_hint'],
  'additionalProperties': False
}

Sløyfe for kritikk og revisjon

Kombiner kritikeren med en reviderer. Kritikeren finner problemer, forfatteren reviderer ved hjelp av kritikken, og prosessen gjentas til resultatet godkjennes eller budsjettet er brukt opp. Dette er den modellbaserte parallellen til reparasjonssløyfen.

draft = author_model(task)
for _ in range(2):
    c = critic_model(draft)
    if c['pass']:
        break
    draft = author_model(task + '\nRevise to fix: ' + c['fix_hint'])
final = draft

Vurderingskriterier gjør kritikken pålitelig

En vag instruks («er dette bra?») gir upålitelige avgjørelser. Et konkret vurderingsgrunnlag med eksplisitte og kontrollerbare kriterier gir konsistente avgjørelser. Del det opp i ja/nei-spørsmål som kritikeren besvarer hver for seg.

RUBRIC = [
  'Does the answer directly address the user question?',
  'Are all factual claims supported by the provided context?',
  'Is any disallowed content present?',
  'Is the response within the requested length?'
]

Forankret kritikk av faktagrunnlaget

For å oppdage hallusinasjoner må De gi kritikeren kildekonteksten og be den markere alle påstander som ikke følger av den. Da blir selvkritikk til en kontroll av logisk medfølge, noe som er langt sterkere enn å spørre «stemmer dette?» uten bevis.

verdict = critic_model(
  'For each claim in the ANSWER, state whether the CONTEXT entails it. '
  'Flag any unsupported claim.\nCONTEXT:\n' + ctx + '\nANSWER:\n' + draft
)

Kritikerens feilmønstre

Kritikeren er selv en LLM og kan feile:

  • Smisking — godkjenner ukritisk forfatterens svar.
  • Overdreven kritikk — markerer korrekte utdata som feil.
  • Felles blindsoner — samme modell overser de samme feilene.

Dette kan motvirkes ved å bruke en annen modellfamilie som kritiker, en streng gjennomgangsrolle og kalibrerte terskler.

Bruk en billigere eller annerledes kritiker

Kritikeren trenger ikke å være den dyreste modellen. Ofte er en mindre modell med et stramt vurderingsgrunnlag en kostnadseffektiv kontroll, og bruk av en annen modellfamilie reduserer korrelerte blindsoner. Reserver den sterkeste modellen til å skrive svarene.

Når De kan stole på modellen, og når De må kontrollere

Selvkritikk reduserer feil, men er ikke et bevis. For innhold med lav risiko er én kritikkrunde tilstrekkelig. For utdata med høy risiko bør De kombinere selvkritikk med deterministiske validatorer og menneskelig gjennomgang. La aldri en modell være eneste instans som avgjør sikkerhetskritiske beslutninger.

Kostnad, forsinkelse og hurtigbufring

Selvkritikk omtrent dobler antallet kall per forespørsel. Begrens dette ved å gjøre kritikken betinget av deterministiske kontroller (kritiser bare det som besto skjema- og regelkontrollene), hurtigbufre kritikk av identiske utkast og begrense antallet revisjonsrunder. Kjør kritikken parallelt med arbeid som ikke blokkerer, når det er mulig.

if deterministic_ok(draft):
    verdict = critic_model(draft)   # only spend critique on viable drafts

Kalibrer mot menneskemerkede resultater

Valider kritikeren før De stoler på den. Bygg et sett med resultater merket av mennesker, kjør kritikeren, og mål samsvaret mellom dens avgjørelser og menneskenes avgjørelser ved hjelp av presisjon og tilbakekalling. Juster vurderingsgrunnlaget og rollen til kritikerens vurderinger samsvarer med menneskenes, og kontroller på nytt etter modelloppgraderinger.

agreement = mean(critic(d)['pass'] == human_label[d] for d in eval_set)
assert agreement > 0.9

Hurtigsjekk

De ønsker at kritikeren pålitelig skal oppdage hallusinasjoner i et RAG-svar. Hva forbedrer påliteligheten mest?

Oppsummering

Validering med selvkritikk:

  • En separat kritiker med ren kontekst vurderer forfatterens utdata.
  • Generer strukturerte avgjørelser, og bruk en sløyfe for kritikk og revisjon.
  • Konkrete vurderingsgrunnlag og forankrede kontroller av logisk medfølge øker påliteligheten.
  • Vær oppmerksom på smisking og felles blindsoner, og bruk en annen kritikkmodell.
  • Begrens etter kostnad, kombiner med deterministiske kontroller, og kalibrer mot mennesker.

De har fullført sikkerhetsmekanismene. Neste kurs: red teaming og konfronterende evaluering.

Gratis å komme i gang

Lær deg AI-prompt engineering med en AI-veileder – gratis

Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.

Kurs
53
Leksjoner
199

Ofte stilte spørsmål

Er leksjonen «Validering med self-critique» gratis?

Ja – du kan lese valgfritt 3 av leksjonene i læringsstien AI-prompt engineering, inkludert «Validering med self-critique», gratis i sin helhet her på nettet. Deretter låser CoddyKit PRO opp alle leksjoner, samt interaktiv øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Kurset i AI-prompt engineering inneholder totalt 4 leksjoner.

Hva lærer jeg i «Validering med self-critique»?

Output kontrollert av modellen. Du øver på AI-prompt engineering med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.

Trenger jeg erfaring for å begynne med AI-prompt engineering?

Ingen tidligere erfaring er nødvendig. AI-prompt engineering på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 4 av 4.

Hvor lang tid tar leksjonen «Validering med self-critique»?

De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.

Kan jeg skrive og kjøre kode i denne AI-prompt engineering-leksjonen?

Ja. Alle AI-prompt engineering-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.

Alle leksjonene i dette kurset

  1. Hva er guardrails
  2. Filtrering av input og output
  3. Skjemavalidatorer og regelvalidatorer
  4. Validering med self-critique
← Tilbake til AI-prompt engineering