0Pricing
AI Prompt Engineering · Lektion

CAI-Prinzipien und Kritik-Prompts

Anthropics Constitutional AI: Selbstkritik auf Grundlage von Prinzipien der Harmlosigkeit.

CAI-Prinzipien und Kritik-Prompts ist eine kostenlose AI Prompt Engineering-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Prompt Engineering-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.

Was ist Constitutional AI?

Constitutional AI (CAI) ist Anthropic's Methode, um KI-Systeme mithilfe einer Reihe schriftlich formulierter Prinzipien — einer Verfassung — hilfreich, harmlos und ehrlich zu trainieren.

Statt sich ausschließlich darauf zu verlassen, dass menschliche Annotatoren schädliche Ausgaben markieren, lässt CAI das Modell seine eigenen Antworten anhand der Verfassung kritisieren und überarbeiten. Das ist besser skalierbar und konsistenter.

Die Verfassung: Schriftlich formulierte Prinzipien

Die CAI-Verfassung ist eine Liste von Prinzipien, die das Modell befolgen muss. Die veröffentlichte Verfassung von Anthropic umfasst Prinzipien, die abgeleitet sind aus:

  • der Allgemeinen Erklärung der Menschenrechte der UN
  • den Richtlinien für den App Store von Apple
  • den internen Richtlinien von Anthropic zur Vermeidung von Schäden

Beispiel für ein Prinzip: "Wählen Sie die Antwort, die am wenigsten wahrscheinlich schädliche, unethische, rassistische, sexistische, toxische, gefährliche oder illegale Inhalte enthält."

Die CAI-Schleife in drei Schritten

Constitutional AI verwendet einen dreistufigen Prozess, um Antworten zu verbessern:

  1. Generieren: Das Modell erzeugt eine erste Antwort (möglicherweise eine schädliche)
  2. Kritisieren: Das Modell bewertet die Antwort anhand eines Prinzips
  3. Überarbeiten: Das Modell formuliert die Antwort neu, um die Kritik zu berücksichtigen

Diese Schleife kann einmal oder mehrmals durchlaufen werden. Jede Iteration richtet die Antwort stärker an der Verfassung aus.

Schritt 1: Eine erste Antwort generieren

Im ersten Schritt wird einfach eine Antwort auf die Anfrage des Benutzers generiert — ohne besondere Einschränkungen. Diese Antwort kann hilfreich, aber auch potenziell schädlich, voreingenommen oder ungenau sein.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Step 1: Generate initial response
def generate_initial(user_request):
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[
            {'role': 'user', 'content': user_request}
        ]
    )
    return response.content[0].text

initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])

Schritt 2: Anhand eines Prinzips kritisieren

Im Kritikschritt erhält das Modell seine eigene erste Antwort und ein bestimmtes Prinzip. Anschließend identifiziert es, wie die Antwort gegen dieses Prinzip verstößt oder es besser erfüllen könnte.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

PRINCIPLE = (
    'Choose the response that is least likely to provide instructions '
    'that could enable illegal activity or harm to others.'
)

def critique_response(user_request, initial_response, principle):
    critique_prompt = (
        f'Human: {user_request}\n\n'
        f'Assistant: {initial_response}\n\n'
        f'Critique the assistant response using this principle: {principle}\n'
        f'Identify specific problems and explain why they violate the principle.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=256,
        messages=[{'role': 'user', 'content': critique_prompt}]
    )
    return response.content[0].text

critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])

Schritt 3: Auf Grundlage der Kritik überarbeiten

Im Überarbeitungsschritt erhält das Modell die Kritik und erzeugt eine neue, verbesserte Antwort, die die identifizierten Probleme behebt und dabei so hilfreich wie möglich bleibt.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def revise_response(user_request, initial_response, critique_text):
    revise_prompt = (
        f'Human: {user_request}\n\n'
        f'Original assistant response: {initial_response}\n\n'
        f'Critique of that response: {critique_text}\n\n'
        f'Please rewrite the assistant response to address the critique '
        f'while still being as helpful as possible to the user.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[{'role': 'user', 'content': revise_prompt}]
    )
    return response.content[0].text

revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])

Auswählen, welche Prinzipien angewendet werden

Die CAI-Verfassung enthält viele Prinzipien. Sie wenden nicht alle auf jede Antwort an — das wäre langsam und redundant.

In der Praxis wählen Sie Prinzipien aus, die für die jeweilige Domäne oder Risikostufe relevant sind:

  • Hochrisikodomänen: 3–5 Sicherheitsprinzipien anwenden
  • Allgemeiner Assistent: 1–2 breit anwendbare Prinzipien anwenden
  • Kreatives Schreiben: Prinzipien zu Rechtmäßigkeit und expliziten Inhalten anwenden
# Example principles from Anthropic's published constitution
PRINCIPLES = [
    'Choose the response that is least likely to contain harmful, '
    'unethical, racist, sexist, toxic, dangerous, or illegal content.',

    'Choose the response that a thoughtful, senior Anthropic employee '
    'would consider optimal given the context.',

    'Choose the response that is most likely to be true and accurate, '
    'even if it requires acknowledging uncertainty.',

    'Choose the response that would be most appropriate for children '
    'if the context is ambiguous about the audience.',
]

# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]

# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]

CAI in RLHF: SL-CAI und RLCAI

Anthropic verwendet CAI in zwei Trainingsphasen:

  • SL-CAI: Überwachtes Lernen — erzeugt Paare aus Kritik und Überarbeitung und verwendet die überarbeiteten Antworten zur Feinabstimmung des Modells
  • RLCAI: Reinforcement Learning — verwendet ein mit CAI trainiertes Präferenzmodell als Belohnungssignal anstelle menschlicher Präferenzannotationen

Als Prompt Engineer wenden Sie CAI-Prinzipien zur Inferenzzeit in Ihren Anwendungen an — mit derselben Kritik-Überarbeitungs-Logik, aber ohne die Trainingsinfrastruktur.

Helpful, Harmless und Honest — das HHH-Framework

Das Trainingsziel von Anthropic ist das HHH-Framework:

  • Helpful: Unterstützt den Benutzer bei seiner Anfrage aufrichtig
  • Harmless: Vermeidet Schäden für Benutzer, Dritte oder die Gesellschaft
  • Honest: Täuscht nicht und behauptet keine Sicherheit, die es nicht besitzt

Diese drei Ziele stehen manchmal miteinander im Konflikt — und der Kritik-Überarbeitungs-Prozess von CAI ist darauf ausgelegt, Antworten zu finden, die alle drei gleichzeitig erfüllen.

Vorlage für einen CAI-Kritik-Prompt

Eine zuverlässige Vorlage für einen Kritik-Prompt, die Sie an Ihre Anwendungen anpassen können:

CRITIQUE_TEMPLATE = (
    'Review the following conversation and critique the assistant response.\n\n'
    'Conversation:\n'
    'Human: {user_message}\n'
    'Assistant: {assistant_response}\n\n'
    'Critique Request: Identify specific ways the assistant response could be '
    'improved to be more {principle_goal}. '
    'If the response is already excellent, say so briefly.\n\n'
    'Critique:'
)

# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
    user_message='How do I make someone angry at a party?',
    assistant_response='Here are some classic pranks you can try...',
    principle_goal='harmless and considerate of all people involved'
)

print(harmless_critique[:300])

Wann CAI-Schleifen angewendet werden sollten

Nicht jede Antwort benötigt einen Kritik-Überarbeitungs-Zyklus. Wenden Sie CAI an, wenn:

  • die Anfrage aus einer Hochrisikodomäne stammt (Gesundheit, Recht, Sicherheit)
  • die erste Antwort ausweichend oder potenziell schädlich wirkt
  • Ihre Anwendung strenge Anforderungen an Inhalte hat
  • Sie vor der Anzeige der Ausgabe für Benutzer eine Qualitätssicherung wünschen

Bei risikoarmen, routinemäßigen Anfragen können Sie CAI überspringen, um Latenz und Kosten zu sparen.

Wissenscheck: Die CAI-Schleife in drei Schritten

Wie lautet die richtige Reihenfolge der Schritte in der Kritikschleife von Constitutional AI?

Zusammenfassung: CAI-Prinzipien und Kritik-Prompts

Constitutional AI verwendet eine dreistufige Schleife: Zuerst wird eine erste Antwort generiert, anschließend anhand eines schriftlich formulierten Prinzips kritisiert und schließlich zur Erstellung einer besseren Ausgabe überarbeitet. Die Verfassung ist eine Liste von Prinzipien, bei denen Hilfsbereitschaft, Schadensfreiheit und Ehrlichkeit im Vordergrund stehen. Anthropic setzt CAI sowohl in Phasen des überwachten Feintrainings als auch in RLHF-Phasen ein. Auf Anwendungsebene implementieren Sie dieselbe Kritik-Überarbeitungs-Logik zur Inferenzzeit mithilfe von API-Aufrufen. Wenden Sie CAI gezielt in Hochrisikodomänen an, um Sicherheit, Latenz und Kosten ausgewogen zu berücksichtigen.

Häufig gestellte Fragen

Ist die Lektion „CAI-Prinzipien und Kritik-Prompts“ kostenlos?

Ja — der vollständige Text von „CAI-Prinzipien und Kritik-Prompts“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Prompt Engineering-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „CAI-Prinzipien und Kritik-Prompts“?

Anthropics Constitutional AI: Selbstkritik auf Grundlage von Prinzipien der Harmlosigkeit. Du übst AI Prompt Engineering mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Prompt Engineering zu starten?

Keine Vorkenntnisse erforderlich. AI Prompt Engineering auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.

Wie lange dauert die Lektion „CAI-Prinzipien und Kritik-Prompts“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Prompt Engineering-Lektion Code schreiben und ausführen?

Ja. Jede AI Prompt Engineering-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. CAI-Prinzipien und Kritik-Prompts
  2. Muster für Selbstkritik und Überarbeitung
  3. Spannungsfeld zwischen Harmlosigkeit und Hilfsbereitschaft
  4. CAI in Anwendungen implementieren
← Zurück zu AI Prompt Engineering