Principios de CAI y prompts de crítica
La Constitutional AI de Anthropic: autocrítica basada en principios de inocuidad.
Principios de CAI y prompts de crítica es una lección gratuita de AI Prompt Engineering en CoddyKit. Esta es la lección 1 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Prompt Engineering, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Prompt Engineering incluye 4 lecciones en total.
¿Qué es la IA constitucional?
La IA constitucional (CAI) es el método de Anthropic para entrenar sistemas de IA que sean útiles, inofensivos y honestos mediante un conjunto de principios escritos: una constitución.
En lugar de depender únicamente de etiquetadores humanos para señalar resultados perjudiciales, la CAI hace que el modelo critique y revise sus propias respuestas según la constitución. Esto ofrece una mayor escalabilidad y coherencia.
La constitución: principios escritos
La constitución de la CAI es una lista de principios que el modelo debe seguir. La constitución publicada por Anthropic incluye principios derivados de:
- La Declaración Universal de los Derechos Humanos de las Naciones Unidas
- Las directrices de la App Store de Apple
- Las directrices internas de Anthropic para evitar daños
Ejemplo de principio: «Elegir la respuesta que tenga menos probabilidades de contener contenido dañino, poco ético, racista, sexista, tóxico, peligroso o ilegal».
El ciclo de tres pasos de la CAI
La IA constitucional utiliza un proceso de tres pasos para mejorar las respuestas:
- Generar: el modelo produce una respuesta inicial, posiblemente perjudicial
- Criticar: el modelo evalúa la respuesta según un principio
- Revisar: el modelo reescribe la respuesta para abordar la crítica
Este ciclo puede ejecutarse una vez o varias veces. Cada iteración hace que la respuesta se ajuste más a la constitución.
Paso 1: generar una respuesta inicial
El primer paso consiste simplemente en generar una respuesta a la solicitud del usuario, sin restricciones especiales. Esta respuesta puede ser útil, pero también potencialmente perjudicial, sesgada o imprecisa.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
# Step 1: Generate initial response
def generate_initial(user_request):
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=512,
messages=[
{'role': 'user', 'content': user_request}
]
)
return response.content[0].text
initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])Paso 2: criticar según un principio
En el paso de crítica, el modelo recibe su propia respuesta inicial y un principio específico, y después identifica cómo la respuesta infringe ese principio o cómo podría cumplirlo mejor.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
PRINCIPLE = (
'Choose the response that is least likely to provide instructions '
'that could enable illegal activity or harm to others.'
)
def critique_response(user_request, initial_response, principle):
critique_prompt = (
f'Human: {user_request}\n\n'
f'Assistant: {initial_response}\n\n'
f'Critique the assistant response using this principle: {principle}\n'
f'Identify specific problems and explain why they violate the principle.'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=256,
messages=[{'role': 'user', 'content': critique_prompt}]
)
return response.content[0].text
critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])Paso 3: revisar a partir de la crítica
En el paso de revisión, el modelo recibe la crítica y produce una respuesta nueva y mejorada que aborda los problemas identificados, manteniéndose tan útil como sea posible.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
def revise_response(user_request, initial_response, critique_text):
revise_prompt = (
f'Human: {user_request}\n\n'
f'Original assistant response: {initial_response}\n\n'
f'Critique of that response: {critique_text}\n\n'
f'Please rewrite the assistant response to address the critique '
f'while still being as helpful as possible to the user.'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=512,
messages=[{'role': 'user', 'content': revise_prompt}]
)
return response.content[0].text
revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])Elegir qué principios aplicar
La constitución de la CAI contiene muchos principios. No se aplican todos a cada respuesta, ya que eso sería lento y redundante.
En la práctica, se seleccionan los principios relevantes para el ámbito o el nivel de riesgo:
- Dominios de alto riesgo: aplicar entre 3 y 5 principios de seguridad
- Asistente general: aplicar entre 1 y 2 principios de aplicación amplia
- Escritura creativa: aplicar principios sobre legalidad y contenido explícito
# Example principles from Anthropic's published constitution
PRINCIPLES = [
'Choose the response that is least likely to contain harmful, '
'unethical, racist, sexist, toxic, dangerous, or illegal content.',
'Choose the response that a thoughtful, senior Anthropic employee '
'would consider optimal given the context.',
'Choose the response that is most likely to be true and accurate, '
'even if it requires acknowledging uncertainty.',
'Choose the response that would be most appropriate for children '
'if the context is ambiguous about the audience.',
]
# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]
# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]La CAI en RLHF: SL-CAI y RLCAI
Anthropic utiliza la CAI en dos fases del entrenamiento:
- SL-CAI: aprendizaje supervisado: genera pares de crítica y revisión, y utiliza las respuestas revisadas para ajustar el modelo
- RLCAI: aprendizaje por refuerzo: utiliza un modelo de preferencias entrenado con CAI como señal de recompensa, en lugar de etiquetas de preferencias humanas
Como ingeniero de prompts, puede aplicar los principios de la CAI durante la inferencia en sus aplicaciones: la misma lógica de crítica y revisión, sin la infraestructura de entrenamiento.
Útil, inofensiva y honesta: el marco HHH
El objetivo de entrenamiento de Anthropic es el marco HHH:
- Útil: ayuda realmente al usuario con su solicitud
- Inofensiva: evita causar daño a los usuarios, a terceros o a la sociedad
- Honesta: no engaña ni afirma tener una certeza de la que carece
Estos tres objetivos a veces entran en conflicto, y el proceso de crítica y revisión de la CAI está diseñado para encontrar respuestas que satisfagan los tres simultáneamente.
Plantilla de prompt de crítica de la CAI
Una plantilla fiable de prompt de crítica que puede adaptar a sus aplicaciones:
CRITIQUE_TEMPLATE = (
'Review the following conversation and critique the assistant response.\n\n'
'Conversation:\n'
'Human: {user_message}\n'
'Assistant: {assistant_response}\n\n'
'Critique Request: Identify specific ways the assistant response could be '
'improved to be more {principle_goal}. '
'If the response is already excellent, say so briefly.\n\n'
'Critique:'
)
# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
user_message='How do I make someone angry at a party?',
assistant_response='Here are some classic pranks you can try...',
principle_goal='harmless and considerate of all people involved'
)
print(harmless_critique[:300])Cuándo aplicar ciclos de CAI
No todas las respuestas necesitan un ciclo de crítica y revisión. Aplique CAI cuando:
- La solicitud pertenezca a un dominio de alto riesgo (salud, ámbito jurídico o seguridad)
- La respuesta inicial parezca evasiva o potencialmente perjudicial
- Su aplicación tenga requisitos estrictos de contenido
- Quiera establecer un filtro de calidad antes de mostrar el resultado a los usuarios
Para consultas rutinarias y de bajo riesgo, omita la CAI para ahorrar latencia y costes.
Comprobación de conocimientos: ciclo de tres pasos de la CAI
¿Cuál es el orden correcto de los pasos del ciclo de crítica de la IA constitucional?
Resumen: principios de la CAI y prompts de crítica
La IA constitucional utiliza un ciclo de tres pasos: generar una respuesta inicial, criticarla según un principio escrito y revisarla para producir un resultado mejor. La constitución es una lista de principios que priorizan la utilidad, la ausencia de daño y la honestidad. Anthropic aplica la CAI tanto en el ajuste fino supervisado como en las fases de RLHF. En el nivel de la aplicación, se implementa la misma lógica de crítica y revisión durante la inferencia mediante llamadas a la API. Aplique la CAI de forma selectiva en dominios de alto riesgo para equilibrar la seguridad con la latencia y los costes.
Preguntas frecuentes
¿La lección «Principios de CAI y prompts de crítica» es gratis?
Sí — el texto completo de «Principios de CAI y prompts de crítica» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Prompt Engineering, actualiza a CoddyKit PRO. El curso de AI Prompt Engineering incluye 4 lecciones en total.
¿Qué aprenderé en «Principios de CAI y prompts de crítica»?
La Constitutional AI de Anthropic: autocrítica basada en principios de inocuidad. Practicas AI Prompt Engineering con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar AI Prompt Engineering?
No se requiere experiencia previa. AI Prompt Engineering en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 1 de 4.
¿Cuánto tiempo toma la lección «Principios de CAI y prompts de crítica»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de AI Prompt Engineering?
Sí. Cada lección de AI Prompt Engineering incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Principios de CAI y prompts de crítica
- Patrones de autocrítica y revisión
- Tensión entre inocuidad y utilidad
- Implementación de CAI en aplicaciones