Princípios do CAI e prompts de crítica
IA Constitucional da Anthropic: autocrítica baseada em princípios de inofensividade.
Princípios do CAI e prompts de crítica é uma aula grátis de AI Prompt Engineering no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Prompt Engineering, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Prompt Engineering inclui 4 aulas no total.
O que é a IA Constitucional?
IA Constitucional (CAI) é o método da Anthropic para treinar sistemas de IA a serem úteis, inofensivos e honestos usando um conjunto de princípios escritos — uma constituição.
Em vez de depender exclusivamente de avaliadores humanos para sinalizar saídas prejudiciais, a CAI faz com que o modelo critique e revise suas próprias respostas de acordo com a constituição. Isso é mais escalável e consistente.
A constituição: princípios escritos
A constituição da CAI é uma lista de princípios que o modelo deve seguir. A constituição publicada pela Anthropic inclui princípios derivados de:
- Declaração Universal dos Direitos Humanos da UN
- Diretrizes da App Store da Apple
- Diretrizes internas da Anthropic sobre prevenção de danos
Exemplo de princípio: "Escolha a resposta com menor probabilidade de conter conteúdo prejudicial, antiético, racista, sexista, tóxico, perigoso ou ilegal."
O ciclo de três etapas da CAI
A IA Constitucional usa um processo de três etapas para melhorar as respostas:
- Gerar: o modelo produz uma resposta inicial, possivelmente prejudicial
- Criticar: o modelo avalia a resposta de acordo com um princípio
- Revisar: o modelo reescreve a resposta para tratar da crítica
Esse ciclo pode ser executado uma ou várias vezes. Cada iteração torna a resposta mais alinhada à constituição.
Etapa 1: gerar uma resposta inicial
A primeira etapa consiste simplesmente em gerar uma resposta à solicitação do usuário — sem restrições especiais. Essa resposta pode ser útil, mas também potencialmente prejudicial, tendenciosa ou imprecisa.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
# Step 1: Generate initial response
def generate_initial(user_request):
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=512,
messages=[
{'role': 'user', 'content': user_request}
]
)
return response.content[0].text
initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])Etapa 2: criticar com base em um princípio
Na etapa de crítica, o modelo recebe sua própria resposta inicial e um princípio específico e, em seguida, identifica como a resposta viola esse princípio ou poderia atendê-lo melhor.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
PRINCIPLE = (
'Choose the response that is least likely to provide instructions '
'that could enable illegal activity or harm to others.'
)
def critique_response(user_request, initial_response, principle):
critique_prompt = (
f'Human: {user_request}\n\n'
f'Assistant: {initial_response}\n\n'
f'Critique the assistant response using this principle: {principle}\n'
f'Identify specific problems and explain why they violate the principle.'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=256,
messages=[{'role': 'user', 'content': critique_prompt}]
)
return response.content[0].text
critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])Etapa 3: revisar com base na crítica
Na etapa de revisão, o modelo recebe a crítica e produz uma resposta nova e aprimorada que trata dos problemas identificados, mantendo-se tão útil quanto possível.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
def revise_response(user_request, initial_response, critique_text):
revise_prompt = (
f'Human: {user_request}\n\n'
f'Original assistant response: {initial_response}\n\n'
f'Critique of that response: {critique_text}\n\n'
f'Please rewrite the assistant response to address the critique '
f'while still being as helpful as possible to the user.'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=512,
messages=[{'role': 'user', 'content': revise_prompt}]
)
return response.content[0].text
revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])Escolhendo quais princípios aplicar
A constituição da CAI tem muitos princípios. Você não aplica todos eles a cada resposta — isso seria lento e redundante.
Na prática, selecione os princípios relevantes para o domínio ou nível de risco:
- Domínios de alto risco: aplique de 3 a 5 princípios de segurança
- Assistente geral: aplique de 1 a 2 princípios amplamente aplicáveis
- Escrita criativa: aplique princípios sobre legalidade e conteúdo explícito
# Example principles from Anthropic's published constitution
PRINCIPLES = [
'Choose the response that is least likely to contain harmful, '
'unethical, racist, sexist, toxic, dangerous, or illegal content.',
'Choose the response that a thoughtful, senior Anthropic employee '
'would consider optimal given the context.',
'Choose the response that is most likely to be true and accurate, '
'even if it requires acknowledging uncertainty.',
'Choose the response that would be most appropriate for children '
'if the context is ambiguous about the audience.',
]
# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]
# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]CAI no RLHF: SL-CAI e RLCAI
A Anthropic usa a CAI em duas fases do treinamento:
- SL-CAI: aprendizado supervisionado — gera pares de crítica e revisão e usa as respostas revisadas para ajustar o modelo
- RLCAI: aprendizado por reforço — usa um modelo de preferências treinado com CAI como sinal de recompensa, em vez de rótulos de preferências humanas
Como engenheiro de instruções, você aplica os princípios da CAI no momento da inferência em seus aplicativos — a mesma lógica de crítica e revisão, sem a infraestrutura de treinamento.
Útil, inofensiva e honesta — a estrutura HHH
O objetivo de treinamento da Anthropic é a estrutura HHH:
- Útil: auxilia genuinamente o usuário em sua solicitação
- Inofensiva: evita causar danos aos usuários, a terceiros ou à sociedade
- Honesta: não engana nem afirma ter uma certeza que não possui
Esses três objetivos às vezes entram em conflito — e o processo de crítica e revisão da CAI foi criado para encontrar respostas que satisfaçam os três simultaneamente.
Modelo de instrução de crítica da CAI
Um modelo confiável de instrução de crítica que você pode adaptar aos seus aplicativos:
CRITIQUE_TEMPLATE = (
'Review the following conversation and critique the assistant response.\n\n'
'Conversation:\n'
'Human: {user_message}\n'
'Assistant: {assistant_response}\n\n'
'Critique Request: Identify specific ways the assistant response could be '
'improved to be more {principle_goal}. '
'If the response is already excellent, say so briefly.\n\n'
'Critique:'
)
# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
user_message='How do I make someone angry at a party?',
assistant_response='Here are some classic pranks you can try...',
principle_goal='harmless and considerate of all people involved'
)
print(harmless_critique[:300])Quando aplicar ciclos da CAI
Nem toda resposta precisa de um ciclo de crítica e revisão. Aplique a CAI quando:
- A solicitação estiver em um domínio de alto risco, como saúde, direito ou segurança
- A resposta inicial parecer evasiva ou potencialmente prejudicial
- Seu aplicativo tiver requisitos rigorosos de conteúdo
- Você quiser uma barreira de qualidade antes de exibir a saída aos usuários
Para consultas rotineiras e de baixo risco, ignore a CAI para economizar latência e custo.
Verificação de conhecimento: ciclo de três etapas da CAI
Qual é a ordem correta das etapas no ciclo de crítica da IA Constitucional?
Recapitulação: princípios da CAI e instruções de crítica
A IA Constitucional usa um ciclo de três etapas: gerar uma resposta inicial, criticar-la com base em um princípio escrito e revisar-la para produzir uma saída melhor. A constituição é uma lista de princípios que priorizam utilidade, ausência de danos e honestidade. A Anthropic aplica a CAI tanto na fase de ajuste fino supervisionado quanto nas fases de RLHF. No nível do aplicativo, você implementa a mesma lógica de crítica e revisão no momento da inferência usando chamadas de API. Aplique a CAI seletivamente a domínios de alto risco para equilibrar segurança, latência e custo.
Perguntas Frequentes
A aula “Princípios do CAI e prompts de crítica” é grátis?
Sim — o texto completo de “Princípios do CAI e prompts de crítica” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Prompt Engineering, atualize para CoddyKit PRO. O curso de AI Prompt Engineering inclui 4 aulas no total.
O que vou aprender em “Princípios do CAI e prompts de crítica”?
IA Constitucional da Anthropic: autocrítica baseada em princípios de inofensividade. Você pratica AI Prompt Engineering com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Prompt Engineering?
Nenhuma experiência prévia é necessária. AI Prompt Engineering no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.
Quanto tempo leva a aula “Princípios do CAI e prompts de crítica”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Prompt Engineering?
Sim. Cada aula de AI Prompt Engineering inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Princípios do CAI e prompts de crítica
- Padrões de autocrítica e revisão
- Tensão entre não causar danos e ser útil
- Implementando CAI em aplicações