0Pricing
AI Prompt Engineering · Leçon

Principes de CAI et prompts de critique

IA constitutionnelle d’Anthropic : autocritique fondée sur des principes d’innocuité.

Principes de CAI et prompts de critique est une leçon AI Prompt Engineering gratuite sur CoddyKit. Ceci est la leçon 1 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Prompt Engineering, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Prompt Engineering comprend 4 leçons au total.

Qu'est-ce que l'IA constitutionnelle ?

L'IA constitutionnelle (CAI) est la méthode d'Anthropic pour entraîner des systèmes d'IA afin qu'ils soient utiles, inoffensifs et honnêtes, en s'appuyant sur un ensemble de principes écrits — une constitution.

Plutôt que de compter uniquement sur des annotateurs humains pour signaler les sorties nuisibles, la CAI demande au modèle de critiquer et de réviser ses propres réponses au regard de la constitution. Cette méthode est à la fois plus évolutive et plus cohérente.

La constitution : des principes écrits

La constitution de la CAI est une liste de principes que le modèle doit respecter. La constitution publiée par Anthropic comprend des principes issus des sources suivantes :

  • La Déclaration universelle des droits de l'homme de l'UN
  • Les lignes directrices de l'App Store d'Apple
  • Les lignes directrices internes d'Anthropic sur la prévention des préjudices

Example de principe : "Choisissez la réponse la moins susceptible de contenir du contenu nuisible, contraire à l'éthique, raciste, sexiste, toxique, dangereux ou illégal."

La boucle de CAI en trois étapes

L'IA constitutionnelle utilise un processus en trois étapes pour améliorer les réponses :

  1. Générer : le modèle produit une réponse initiale, éventuellement nuisible
  2. Critiquer : le modèle évalue la réponse au regard d'un principe
  3. Réviser : le modèle réécrit la réponse pour tenir compte de la critique

Cette boucle peut être exécutée une seule fois ou plusieurs fois. Chaque itération rend la réponse plus conforme à la constitution.

Étape 1 : générer une réponse initiale

La première étape consiste simplement à générer une réponse à la demande de l'utilisateur, sans contraintes particulières. Cette réponse peut être utile, mais aussi potentiellement nuisible, biaisée ou inexacte.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Step 1: Generate initial response
def generate_initial(user_request):
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[
            {'role': 'user', 'content': user_request}
        ]
    )
    return response.content[0].text

initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])

Étape 2 : critiquer au regard d'un principe

Lors de l'étape de critique, le modèle reçoit sa propre réponse initiale ainsi qu'un principe précis, puis détermine de quelle manière la réponse enfreint ce principe ou pourrait mieux le respecter.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

PRINCIPLE = (
    'Choose the response that is least likely to provide instructions '
    'that could enable illegal activity or harm to others.'
)

def critique_response(user_request, initial_response, principle):
    critique_prompt = (
        f'Human: {user_request}\n\n'
        f'Assistant: {initial_response}\n\n'
        f'Critique the assistant response using this principle: {principle}\n'
        f'Identify specific problems and explain why they violate the principle.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=256,
        messages=[{'role': 'user', 'content': critique_prompt}]
    )
    return response.content[0].text

critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])

Étape 3 : réviser à partir de la critique

Lors de l'étape de révision, le modèle reçoit la critique et produit une réponse nouvelle et améliorée qui corrige les problèmes relevés tout en restant aussi utile que possible.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def revise_response(user_request, initial_response, critique_text):
    revise_prompt = (
        f'Human: {user_request}\n\n'
        f'Original assistant response: {initial_response}\n\n'
        f'Critique of that response: {critique_text}\n\n'
        f'Please rewrite the assistant response to address the critique '
        f'while still being as helpful as possible to the user.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[{'role': 'user', 'content': revise_prompt}]
    )
    return response.content[0].text

revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])

Choisir les principes à appliquer

La constitution de la CAI contient de nombreux principes. Vous ne les appliquez pas tous à chaque réponse, car cela serait lent et redondant.

En pratique, vous sélectionnez les principes pertinents selon le domaine ou le niveau de risque :

  • Domaines à haut risque : appliquez 3 à 5 principes de sécurité
  • Assistant généraliste : appliquez 1 à 2 principes largement applicables
  • Écriture créative : appliquez les principes concernant la légalité et le contenu explicite
# Example principles from Anthropic's published constitution
PRINCIPLES = [
    'Choose the response that is least likely to contain harmful, '
    'unethical, racist, sexist, toxic, dangerous, or illegal content.',

    'Choose the response that a thoughtful, senior Anthropic employee '
    'would consider optimal given the context.',

    'Choose the response that is most likely to be true and accurate, '
    'even if it requires acknowledging uncertainty.',

    'Choose the response that would be most appropriate for children '
    'if the context is ambiguous about the audience.',
]

# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]

# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]

La CAI dans le RLHF : SL-CAI et RLCAI

Anthropic utilise la CAI dans deux phases de l'entraînement :

  • SL-CAI : apprentissage supervisé — génère des paires critique-révision et utilise les réponses révisées pour ajuster finement le modèle
  • RLCAI : apprentissage par renforcement — utilise un modèle de préférences entraîné avec la CAI comme signal de récompense, au lieu d'annotations de préférences humaines

En tant que concepteur d'instructions, vous appliquez les principes de la CAI au moment de l'inférence dans vos applications — avec la même logique de critique-révision, mais sans l'infrastructure d'entraînement.

Utile, inoffensive et honnête — le cadre HHH

L'objectif d'entraînement d'Anthropic est le cadre HHH :

  • Utile : aide véritablement l'utilisateur à répondre à sa demande
  • Inoffensive : évite de causer du tort aux utilisateurs, aux tiers ou à la société
  • Honnête : ne trompe pas et ne prétend pas avoir une certitude qu'elle n'a pas

Ces trois objectifs entrent parfois en conflit — et le processus de critique-révision de la CAI est conçu pour trouver des réponses qui satisfont simultanément les trois.

Modèle d'instruction de critique pour la CAI

Voici un modèle fiable d'instruction de critique que vous pouvez adapter à vos applications :

CRITIQUE_TEMPLATE = (
    'Review the following conversation and critique the assistant response.\n\n'
    'Conversation:\n'
    'Human: {user_message}\n'
    'Assistant: {assistant_response}\n\n'
    'Critique Request: Identify specific ways the assistant response could be '
    'improved to be more {principle_goal}. '
    'If the response is already excellent, say so briefly.\n\n'
    'Critique:'
)

# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
    user_message='How do I make someone angry at a party?',
    assistant_response='Here are some classic pranks you can try...',
    principle_goal='harmless and considerate of all people involved'
)

print(harmless_critique[:300])

Quand appliquer les boucles de CAI

Toutes les réponses n'ont pas besoin d'un cycle de critique-révision. Appliquez la CAI lorsque :

  • La demande concerne un domaine à haut risque (santé, droit, sécurité)
  • La réponse initiale semble évasive ou potentiellement nuisible
  • Votre application est soumise à des exigences strictes en matière de contenu
  • Vous souhaitez effectuer un contrôle qualité avant d'afficher la sortie aux utilisateurs

Pour les demandes courantes à faible risque, ignorez la CAI afin d'économiser du temps de réponse et des coûts.

Vérification des connaissances : boucle de CAI en trois étapes

Quel est l'ordre correct des étapes de la boucle de critique de l'IA constitutionnelle ?

Récapitulatif : principes de la CAI et instructions de critique

L'IA constitutionnelle utilise une boucle en trois étapes : générer une réponse initiale, la critiquer au regard d'un principe écrit, puis la réviser pour produire une meilleure sortie. La constitution est une liste de principes qui donnent la priorité à l'utilité, à l'innocuité et à l'honnêteté. Anthropic applique la CAI lors des phases d'ajustement fin supervisé et de RLHF. Au niveau de l'application, vous implémentez la même logique de critique-révision au moment de l'inférence à l'aide d'appels d'API. Appliquez la CAI de manière sélective dans les domaines à haut risque afin de trouver un équilibre entre sécurité, temps de réponse et coûts.

Questions Fréquemment Posées

La leçon « Principes de CAI et prompts de critique » est-elle gratuite ?

Oui — le texte complet de « Principes de CAI et prompts de critique » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Prompt Engineering, passe à CoddyKit PRO. Le cours AI Prompt Engineering comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Principes de CAI et prompts de critique » ?

IA constitutionnelle d’Anthropic : autocritique fondée sur des principes d’innocuité. Tu pratiques AI Prompt Engineering avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Prompt Engineering ?

Aucune expérience préalable n'est requise. AI Prompt Engineering sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 1 sur 4.

Combien de temps prend la leçon « Principes de CAI et prompts de critique » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Prompt Engineering ?

Oui. Chaque leçon AI Prompt Engineering inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Principes de CAI et prompts de critique
  2. Schémas d’autocritique et de révision
  3. Tension entre innocuité et utilité
  4. Implémenter CAI dans des applications
← Retour à AI Prompt Engineering