Validering med self-critique
Output kontrollert av modellen.
Validering med self-critique er en gratis leksjon i AI-prompt engineering på CoddyKit. Dette er leksjon 4 av 4. Du kan lese valgfritt 3 leksjoner fra denne læringsstien gratis i sin helhet – deretter låser CoddyKit PRO opp alle leksjoner, samt praktisk øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i AI-prompt engineering, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i AI-prompt engineering inneholder totalt 4 leksjoner.
Modellen som sin egen kritiker
Selvkritikk bruker en LLM til å evaluere utdata fra en LLM mot et vurderingsgrunnlag eller en policy. Den oppdager nyanserte feil som deterministiske validatorer ikke kan uttrykke: faktiske inkonsistenser, tone, hjelpsomhet og subtile policybrudd.
Dette er det modellbaserte supplementet til skjema- og regelvalidatorer.
Skill kritikeren fra forfatteren
Kjør kritikken som et eget kall med sin egen prompt, ikke som en instruks på slutten av genereringen. En kritiker med ren kontekst som bare skal vurdere, er langt mer pålitelig enn å be forfatteren vurdere seg selv midt i genereringen, der den er partisk til fordel for sitt eget svar.
draft = author_model(task_prompt)
verdict = critic_model(
'You are a strict reviewer. Judge ONLY the answer below against the rubric.\n'
'Rubric: ' + rubric + '\nAnswer: ' + draft
)Strukturerte resultater fra kritikken
La kritikeren generere strukturerte avgjørelser slik at pipelinen kan handle programmatisk. En kritikk i fritekst kan ikke behandles maskinelt.
CRITIC_SCHEMA = {
'type': 'object',
'properties': {
'pass': {'type': 'boolean'},
'violations': {'type': 'array', 'items': {'type': 'string'}},
'severity': {'type': 'string', 'enum': ['none','minor','major','critical']},
'fix_hint': {'type': 'string'}
},
'required': ['pass','violations','severity','fix_hint'],
'additionalProperties': False
}Sløyfe for kritikk og revisjon
Kombiner kritikeren med en reviderer. Kritikeren finner problemer, forfatteren reviderer ved hjelp av kritikken, og prosessen gjentas til resultatet godkjennes eller budsjettet er brukt opp. Dette er den modellbaserte parallellen til reparasjonssløyfen.
draft = author_model(task)
for _ in range(2):
c = critic_model(draft)
if c['pass']:
break
draft = author_model(task + '\nRevise to fix: ' + c['fix_hint'])
final = draftVurderingskriterier gjør kritikken pålitelig
En vag instruks («er dette bra?») gir upålitelige avgjørelser. Et konkret vurderingsgrunnlag med eksplisitte og kontrollerbare kriterier gir konsistente avgjørelser. Del det opp i ja/nei-spørsmål som kritikeren besvarer hver for seg.
RUBRIC = [
'Does the answer directly address the user question?',
'Are all factual claims supported by the provided context?',
'Is any disallowed content present?',
'Is the response within the requested length?'
]Forankret kritikk av faktagrunnlaget
For å oppdage hallusinasjoner må De gi kritikeren kildekonteksten og be den markere alle påstander som ikke følger av den. Da blir selvkritikk til en kontroll av logisk medfølge, noe som er langt sterkere enn å spørre «stemmer dette?» uten bevis.
verdict = critic_model(
'For each claim in the ANSWER, state whether the CONTEXT entails it. '
'Flag any unsupported claim.\nCONTEXT:\n' + ctx + '\nANSWER:\n' + draft
)Kritikerens feilmønstre
Kritikeren er selv en LLM og kan feile:
- Smisking — godkjenner ukritisk forfatterens svar.
- Overdreven kritikk — markerer korrekte utdata som feil.
- Felles blindsoner — samme modell overser de samme feilene.
Dette kan motvirkes ved å bruke en annen modellfamilie som kritiker, en streng gjennomgangsrolle og kalibrerte terskler.
Bruk en billigere eller annerledes kritiker
Kritikeren trenger ikke å være den dyreste modellen. Ofte er en mindre modell med et stramt vurderingsgrunnlag en kostnadseffektiv kontroll, og bruk av en annen modellfamilie reduserer korrelerte blindsoner. Reserver den sterkeste modellen til å skrive svarene.
Når De kan stole på modellen, og når De må kontrollere
Selvkritikk reduserer feil, men er ikke et bevis. For innhold med lav risiko er én kritikkrunde tilstrekkelig. For utdata med høy risiko bør De kombinere selvkritikk med deterministiske validatorer og menneskelig gjennomgang. La aldri en modell være eneste instans som avgjør sikkerhetskritiske beslutninger.
Kostnad, forsinkelse og hurtigbufring
Selvkritikk omtrent dobler antallet kall per forespørsel. Begrens dette ved å gjøre kritikken betinget av deterministiske kontroller (kritiser bare det som besto skjema- og regelkontrollene), hurtigbufre kritikk av identiske utkast og begrense antallet revisjonsrunder. Kjør kritikken parallelt med arbeid som ikke blokkerer, når det er mulig.
if deterministic_ok(draft):
verdict = critic_model(draft) # only spend critique on viable draftsKalibrer mot menneskemerkede resultater
Valider kritikeren før De stoler på den. Bygg et sett med resultater merket av mennesker, kjør kritikeren, og mål samsvaret mellom dens avgjørelser og menneskenes avgjørelser ved hjelp av presisjon og tilbakekalling. Juster vurderingsgrunnlaget og rollen til kritikerens vurderinger samsvarer med menneskenes, og kontroller på nytt etter modelloppgraderinger.
agreement = mean(critic(d)['pass'] == human_label[d] for d in eval_set)
assert agreement > 0.9Hurtigsjekk
De ønsker at kritikeren pålitelig skal oppdage hallusinasjoner i et RAG-svar. Hva forbedrer påliteligheten mest?
Oppsummering
Validering med selvkritikk:
- En separat kritiker med ren kontekst vurderer forfatterens utdata.
- Generer strukturerte avgjørelser, og bruk en sløyfe for kritikk og revisjon.
- Konkrete vurderingsgrunnlag og forankrede kontroller av logisk medfølge øker påliteligheten.
- Vær oppmerksom på smisking og felles blindsoner, og bruk en annen kritikkmodell.
- Begrens etter kostnad, kombiner med deterministiske kontroller, og kalibrer mot mennesker.
De har fullført sikkerhetsmekanismene. Neste kurs: red teaming og konfronterende evaluering.
Lær deg AI-prompt engineering med en AI-veileder – gratis
Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.
- Kurs
- 53
- Leksjoner
- 199
Ofte stilte spørsmål
Er leksjonen «Validering med self-critique» gratis?
Ja – du kan lese valgfritt 3 av leksjonene i læringsstien AI-prompt engineering, inkludert «Validering med self-critique», gratis i sin helhet her på nettet. Deretter låser CoddyKit PRO opp alle leksjoner, samt interaktiv øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Kurset i AI-prompt engineering inneholder totalt 4 leksjoner.
Hva lærer jeg i «Validering med self-critique»?
Output kontrollert av modellen. Du øver på AI-prompt engineering med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.
Trenger jeg erfaring for å begynne med AI-prompt engineering?
Ingen tidligere erfaring er nødvendig. AI-prompt engineering på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 4 av 4.
Hvor lang tid tar leksjonen «Validering med self-critique»?
De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.
Kan jeg skrive og kjøre kode i denne AI-prompt engineering-leksjonen?
Ja. Alle AI-prompt engineering-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.
Alle leksjonene i dette kurset
- Hva er guardrails
- Filtrering av input og output
- Skjemavalidatorer og regelvalidatorer
- Validering med self-critique