Validierung durch Selbstkritik
Vom Modell geprüfte Ausgaben
Validierung durch Selbstkritik ist eine kostenlose AI Prompt Engineering-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Prompt Engineering-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.
Das Modell als sein eigener Kritiker
Selbstkritik verwendet ein LLM, um die Ausgabe eines LLM anhand einer Bewertungsrubrik oder Richtlinie zu beurteilen. Sie erkennt nuancierte Fehler, die sich mit deterministischen Validatoren nicht abbilden lassen: faktische Widersprüche, Tonalität, Hilfreichkeit und subtile Richtlinienverstöße.
Sie ist die modellbasierte Ergänzung zu Schema- und Regelvalidatoren.
Kritiker und Autor trennen
Führen Sie die Kritik als separaten Aufruf mit einem eigenen Prompt aus, nicht als abschließende Anweisung in der Generierung. Ein Kritiker mit sauberem Kontext, der nur beurteilen soll, ist deutlich zuverlässiger, als den Autor während der Generierung zur Selbstbewertung aufzufordern, da er dabei zu seinem eigenen Ergebnis voreingenommen ist.
draft = author_model(task_prompt)
verdict = critic_model(
'You are a strict reviewer. Judge ONLY the answer below against the rubric.\n'
'Rubric: ' + rubric + '\nAnswer: ' + draft
)Strukturierte Ausgabe der Kritik
Lassen Sie den Kritiker strukturierte Urteile ausgeben, damit die Pipeline programmgesteuert handeln kann. Eine Freitextkritik ist nicht maschinenverwertbar.
CRITIC_SCHEMA = {
'type': 'object',
'properties': {
'pass': {'type': 'boolean'},
'violations': {'type': 'array', 'items': {'type': 'string'}},
'severity': {'type': 'string', 'enum': ['none','minor','major','critical']},
'fix_hint': {'type': 'string'}
},
'required': ['pass','violations','severity','fix_hint'],
'additionalProperties': False
}Schleife aus Kritik und Überarbeitung
Kombinieren Sie den Kritiker mit einem Überarbeiter. Der Kritiker findet Probleme, der Autor überarbeitet die Ausgabe anhand der Kritik; wiederholen Sie dies, bis die Prüfung bestanden ist oder das Budget erschöpft ist. Dies ist die modellbasierte Entsprechung der Reparaturschleife.
draft = author_model(task)
for _ in range(2):
c = critic_model(draft)
if c['pass']:
break
draft = author_model(task + '\nRevise to fix: ' + c['fix_hint'])
final = draftBewertungsrubriken machen Kritik zuverlässig
Eine vage Anweisung („Ist das gut?“) führt zu uneinheitlichen Urteilen. Eine konkrete Bewertungsrubrik mit expliziten, überprüfbaren Kriterien liefert konsistente Ergebnisse. Unterteilen Sie sie in Ja/Nein-Fragen, die der Kritiker einzeln beantwortet.
RUBRIC = [
'Does the answer directly address the user question?',
'Are all factual claims supported by the provided context?',
'Is any disallowed content present?',
'Is the response within the requested length?'
]Kontextbasierte Kritik zur Faktentreue
Geben Sie dem Kritiker zur Erkennung von Halluzinationen den Quellkontext und fordern Sie ihn auf, jede Behauptung zu kennzeichnen, die sich daraus nicht ableiten lässt. Dadurch wird Selbstkritik zu einer Folgerungsprüfung, die deutlich zuverlässiger ist, als ohne Belege zu fragen: „Ist das wahr?“
verdict = critic_model(
'For each claim in the ANSWER, state whether the CONTEXT entails it. '
'Flag any unsupported claim.\nCONTEXT:\n' + ctx + '\nANSWER:\n' + draft
)Fehlermodi des Kritikers
Der Kritiker ist selbst ein LLM und kann Fehler machen:
- Anbiederung — unkritisches Abnicken der Antwort des Autors.
- Überkritik — Kennzeichnen korrekter Ausgaben als fehlerhaft.
- Geteilte blinde Flecken — dasselbe Modell übersieht dieselben Fehler.
Mildern Sie dies durch eine andere Modellfamilie als Kritiker, eine strenge Prüferrolle und kalibrierte Schwellenwerte.
Einen günstigeren oder anderen Kritiker verwenden
Der Kritiker muss nicht das teuerste Modell sein. Oft ist ein kleineres Modell mit einer strengen Bewertungsrubrik ein kostengünstiges Prüfventil, und die Verwendung einer anderen Modellfamilie verringert korrelierte blinde Flecken. Verwenden Sie das leistungsstärkste Modell für die Erstellung.
Wann vertrauen, wann überprüfen
Selbstkritik verringert Fehler, ist aber kein Beweis. Für Inhalte mit geringem Risiko genügt ein einziger Kritikdurchlauf. Für Ausgaben mit hohem Risiko kombinieren Sie Selbstkritik mit deterministischen Validatoren und menschlicher Prüfung; lassen Sie ein Modell niemals allein über sicherheitskritische Entscheidungen befinden.
Kosten, Latenz und Caching
Selbstkritik verdoppelt ungefähr die Anzahl der Aufrufe pro Anfrage. Begrenzen Sie sie: Schalten Sie die Kritik hinter deterministischen Prüfungen ein (kritisieren Sie nur Ausgaben, die Schema und Regeln bestanden haben), speichern Sie Kritiken für identische Entwürfe im Cache und begrenzen Sie die Anzahl der Überarbeitungsrunden. Führen Sie die Kritik nach Möglichkeit parallel zu nicht blockierenden Aufgaben aus.
if deterministic_ok(draft):
verdict = critic_model(draft) # only spend critique on viable draftsAnhand menschlicher Labels kalibrieren
Validieren Sie den Kritiker, bevor Sie ihm vertrauen. Erstellen Sie eine Sammlung von Ausgaben mit menschlichen Labels, lassen Sie den Kritiker darüber urteilen und messen Sie die Übereinstimmung (Precision/Recall im Vergleich zu menschlichen Urteilen). Passen Sie Bewertungsrubrik und Persona an, bis die Urteile des Kritikers mit denen von Menschen korrelieren; überprüfen Sie dies nach Modellaktualisierungen erneut.
agreement = mean(critic(d)['pass'] == human_label[d] for d in eval_set)
assert agreement > 0.9Kurze Überprüfung
Sie möchten, dass der Kritiker Halluzinationen in einer RAG-Antwort zuverlässig erkennt. Was verbessert die Zuverlässigkeit am meisten?
Zusammenfassung
Validierung durch Selbstkritik:
- Ein separater Kritiker mit sauberem Kontext beurteilt die Ausgabe des Autors.
- Geben Sie strukturierte Urteile aus und steuern Sie eine Schleife aus Kritik und Überarbeitung.
- Konkrete Bewertungsrubriken und kontextbasierte Folgerungsprüfungen erhöhen die Zuverlässigkeit.
- Achten Sie auf Anbiederung und geteilte blinde Flecken; verwenden Sie ein anderes Kritiker-Modell.
- Begrenzen Sie die Prüfungen anhand der Kosten, kombinieren Sie sie mit deterministischen Checks und kalibrieren Sie sie an menschlichen Urteilen.
Sie haben die Leitplanken abgeschlossen. Nächster Kurs: Red-Teaming und adversariale Bewertung.
Häufig gestellte Fragen
Ist die Lektion „Validierung durch Selbstkritik“ kostenlos?
Ja — der vollständige Text von „Validierung durch Selbstkritik“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Prompt Engineering-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Validierung durch Selbstkritik“?
Vom Modell geprüfte Ausgaben Du übst AI Prompt Engineering mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um AI Prompt Engineering zu starten?
Keine Vorkenntnisse erforderlich. AI Prompt Engineering auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.
Wie lange dauert die Lektion „Validierung durch Selbstkritik“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser AI Prompt Engineering-Lektion Code schreiben und ausführen?
Ja. Jede AI Prompt Engineering-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Was sind Guardrails?
- Ein- und Ausgabefilterung
- Schema- und Regelvalidierer
- Validierung durch Selbstkritik