Principi CAI e prompt di critica
La Constitutional AI di Anthropic: autocritica basata sui principi di innocuità
Principi CAI e prompt di critica è una lezione AI Prompt Engineering gratuita su CoddyKit. Questa è la lezione 1 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Prompt Engineering, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Prompt Engineering include 4 lezioni in totale.
Che cos'è Constitutional AI?
Constitutional AI (CAI) è il metodo di Anthropic per addestrare sistemi di IA a essere utili, innocui e onesti, utilizzando un insieme di principi scritti: una costituzione.
Anziché affidarsi esclusivamente a revisori umani per segnalare gli output dannosi, CAI fa sì che il modello critichi e corregga le proprie risposte confrontandole con la costituzione. Questo approccio è più scalabile e coerente.
La costituzione: principi scritti
La costituzione di CAI è un elenco di principi che il modello deve seguire. La costituzione pubblicata da Anthropic include principi derivati da:
- La Dichiarazione universale dei diritti umani dell'ONU
- Le linee guida dell'App Store di Apple
- Le linee guida interne di Anthropic per evitare i danni
Esempio di principio: "Scelga la risposta che ha meno probabilità di contenere contenuti dannosi, non etici, razzisti, sessisti, tossici, pericolosi o illegali."
Il ciclo CAI in tre passaggi
Constitutional AI utilizza un processo in tre passaggi per migliorare le risposte:
- Generazione: il modello produce una risposta iniziale, eventualmente dannosa
- Critica: il modello valuta la risposta rispetto a un principio
- Revisione: il modello riscrive la risposta per tenere conto della critica
Il ciclo può essere eseguito una o più volte. Ogni iterazione rende la risposta più allineata alla costituzione.
Passaggio 1: generare una risposta iniziale
Il primo passaggio consiste semplicemente nel generare una risposta alla richiesta dell'utente, senza vincoli speciali. La risposta potrebbe essere utile, ma anche potenzialmente dannosa, distorta o inaccurata.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
# Step 1: Generate initial response
def generate_initial(user_request):
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=512,
messages=[
{'role': 'user', 'content': user_request}
]
)
return response.content[0].text
initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])Passaggio 2: criticare rispetto a un principio
Nel passaggio di critica, il modello riceve la propria risposta iniziale e un principio specifico, quindi individua i modi in cui la risposta viola tale principio o potrebbe rispettarlo meglio.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
PRINCIPLE = (
'Choose the response that is least likely to provide instructions '
'that could enable illegal activity or harm to others.'
)
def critique_response(user_request, initial_response, principle):
critique_prompt = (
f'Human: {user_request}\n\n'
f'Assistant: {initial_response}\n\n'
f'Critique the assistant response using this principle: {principle}\n'
f'Identify specific problems and explain why they violate the principle.'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=256,
messages=[{'role': 'user', 'content': critique_prompt}]
)
return response.content[0].text
critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])Passaggio 3: rivedere sulla base della critica
Nel passaggio di revisione, il modello riceve la critica e produce una risposta nuova e migliorata, che risolve i problemi individuati rimanendo il più possibile utile.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
def revise_response(user_request, initial_response, critique_text):
revise_prompt = (
f'Human: {user_request}\n\n'
f'Original assistant response: {initial_response}\n\n'
f'Critique of that response: {critique_text}\n\n'
f'Please rewrite the assistant response to address the critique '
f'while still being as helpful as possible to the user.'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=512,
messages=[{'role': 'user', 'content': revise_prompt}]
)
return response.content[0].text
revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])Scegliere quali principi applicare
La costituzione di CAI contiene molti principi. Non li si applica tutti a ogni risposta: sarebbe lento e ridondante.
In pratica, si selezionano i principi pertinenti al dominio o al livello di rischio:
- Domini ad alto rischio: applichi 3-5 principi di sicurezza
- Assistente generico: applichi 1-2 principi ampiamente applicabili
- Scrittura creativa: applichi i principi relativi alla legalità e ai contenuti espliciti
# Example principles from Anthropic's published constitution
PRINCIPLES = [
'Choose the response that is least likely to contain harmful, '
'unethical, racist, sexist, toxic, dangerous, or illegal content.',
'Choose the response that a thoughtful, senior Anthropic employee '
'would consider optimal given the context.',
'Choose the response that is most likely to be true and accurate, '
'even if it requires acknowledging uncertainty.',
'Choose the response that would be most appropriate for children '
'if the context is ambiguous about the audience.',
]
# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]
# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]CAI nell'RLHF: SL-CAI e RLCAI
Anthropic utilizza CAI in due fasi dell'addestramento:
- SL-CAI: apprendimento supervisionato: genera coppie critica-revisione e utilizza le risposte riviste per il fine-tuning del modello
- RLCAI: apprendimento per rinforzo: utilizza un modello delle preferenze addestrato con CAI come segnale di ricompensa, anziché etichette delle preferenze umane
In qualità di prompt engineer, applica i principi di CAI al momento dell'inferenza nelle sue applicazioni, utilizzando la stessa logica critica-revisione ma senza l'infrastruttura di addestramento.
Utile, innocua e onesta: il framework HHH
L'obiettivo dell'addestramento di Anthropic è il framework HHH:
- Utile: assiste concretamente l'utente nella sua richiesta
- Innocua: evita di causare danni agli utenti, a terzi o alla società
- Onesta: non inganna e non esprime una certezza che non possiede
Questi tre obiettivi a volte entrano in conflitto; il processo di critica e revisione di CAI è progettato per trovare risposte che li soddisfino tutti contemporaneamente.
Modello di prompt per la critica CAI
Ecco un modello affidabile di prompt per la critica, che può adattare alle sue applicazioni:
CRITIQUE_TEMPLATE = (
'Review the following conversation and critique the assistant response.\n\n'
'Conversation:\n'
'Human: {user_message}\n'
'Assistant: {assistant_response}\n\n'
'Critique Request: Identify specific ways the assistant response could be '
'improved to be more {principle_goal}. '
'If the response is already excellent, say so briefly.\n\n'
'Critique:'
)
# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
user_message='How do I make someone angry at a party?',
assistant_response='Here are some classic pranks you can try...',
principle_goal='harmless and considerate of all people involved'
)
print(harmless_critique[:300])Quando applicare i cicli CAI
Non tutte le risposte richiedono un ciclo di critica e revisione. Applichi CAI quando:
- La richiesta riguarda un dominio ad alto rischio, come salute, diritto o sicurezza
- La risposta iniziale sembra evasiva o potenzialmente dannosa
- La sua applicazione prevede requisiti rigorosi sui contenuti
- Desidera un controllo di qualità prima di mostrare l'output agli utenti
Per le domande di routine e a basso rischio, eviti CAI per ridurre latenza e costi.
Verifica delle conoscenze: ciclo CAI in tre passaggi
Qual è l'ordine corretto dei passaggi nel ciclo di critica di Constitutional AI?
Riepilogo: principi CAI e prompt di critica
Constitutional AI utilizza un ciclo in tre passaggi: generare una risposta iniziale, criticarla rispetto a un principio scritto e rivederla per produrre un output migliore. La costituzione è un elenco di principi che danno priorità all'utilità, all'innocuità e all'onestà. Anthropic applica CAI sia nella fase di fine-tuning supervisionato sia in quella di RLHF. A livello applicativo, si implementa la stessa logica di critica e revisione durante l'inferenza, utilizzando chiamate API. Applichi CAI in modo selettivo nei domini ad alto rischio, per trovare un equilibrio tra sicurezza, latenza e costi.
Domande Frequenti
La lezione «Principi CAI e prompt di critica» è gratuita?
Sì — il testo completo di «Principi CAI e prompt di critica» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Prompt Engineering, passa a CoddyKit PRO. Il corso AI Prompt Engineering include 4 lezioni in totale.
Cosa imparerò in «Principi CAI e prompt di critica»?
La Constitutional AI di Anthropic: autocritica basata sui principi di innocuità Eserciti AI Prompt Engineering con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare AI Prompt Engineering?
Non è richiesta alcuna esperienza precedente. AI Prompt Engineering su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 1 di 4.
Quanto tempo richiede la lezione «Principi CAI e prompt di critica»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione AI Prompt Engineering?
Sì. Ogni lezione AI Prompt Engineering include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Principi CAI e prompt di critica
- Pattern di autocritica e revisione
- Tensione tra innocuità e utilità
- Implementazione di CAI nelle applicazioni