Принципы CAI и запросы для критики
Конституционный искусственный интеллект Anthropic: самокритика на основе принципов безвредности.
«Принципы CAI и запросы для критики» — бесплатный урок AI Prompt Engineering на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Prompt Engineering, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Prompt Engineering содержит 4 уроков всего.
Что такое Конституционный ИИ?
Конституционный ИИ (CAI) — это метод Anthropic для обучения систем ИИ быть полезными, безвредными и честными с помощью набора письменных принципов — конституции.
Вместо того чтобы полагаться только на людей-разметчиков, отмечающих вредные ответы, CAI заставляет модель критиковать и исправлять собственные ответы в соответствии с конституцией. Это обеспечивает лучшую масштабируемость и большую последовательность.
Конституция: письменные принципы
Конституция CAI — это список принципов, которым должна следовать модель. Опубликованная конституция Anthropic включает принципы, основанные на следующих источниках:
- Декларация UN о правах человека
- рекомендации магазина приложений Apple
- внутренние рекомендации Anthropic по предотвращению вреда
Example: «Выбирайте ответ, который с наименьшей вероятностью содержит вредоносный, неэтичный, расистский, сексистский, токсичный, опасный или незаконный контент».
Трёхэтапный цикл CAI
Конституционный ИИ использует трёхэтапный процесс улучшения ответов:
- Генерация: модель создаёт первоначальный ответ, который может быть вредным
- Критика: модель оценивает ответ по принципу
- Исправление: модель переписывает ответ с учётом критики
Этот цикл может выполняться один или несколько раз. Каждая итерация делает ответ более соответствующим конституции.
Шаг 1: генерация первоначального ответа
Первый шаг — просто создать ответ на запрос пользователя без каких-либо особых ограничений. Этот ответ может быть полезным, но также потенциально вредным, предвзятым или неточным.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
# Step 1: Generate initial response
def generate_initial(user_request):
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=512,
messages=[
{'role': 'user', 'content': user_request}
]
)
return response.content[0].text
initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])Шаг 2: критика на соответствие принципу
На этапе критики модель получает собственный первоначальный ответ и конкретный принцип, а затем определяет, как ответ нарушает этот принцип или как его можно лучше этому принципу удовлетворить.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
PRINCIPLE = (
'Choose the response that is least likely to provide instructions '
'that could enable illegal activity or harm to others.'
)
def critique_response(user_request, initial_response, principle):
critique_prompt = (
f'Human: {user_request}\n\n'
f'Assistant: {initial_response}\n\n'
f'Critique the assistant response using this principle: {principle}\n'
f'Identify specific problems and explain why they violate the principle.'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=256,
messages=[{'role': 'user', 'content': critique_prompt}]
)
return response.content[0].text
critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])Шаг 3: исправление на основе критики
На этапе исправления модель получает критическое заключение и создаёт новый, улучшенный ответ, устраняющий выявленные проблемы и остающийся настолько полезным, насколько это возможно.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
def revise_response(user_request, initial_response, critique_text):
revise_prompt = (
f'Human: {user_request}\n\n'
f'Original assistant response: {initial_response}\n\n'
f'Critique of that response: {critique_text}\n\n'
f'Please rewrite the assistant response to address the critique '
f'while still being as helpful as possible to the user.'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=512,
messages=[{'role': 'user', 'content': revise_prompt}]
)
return response.content[0].text
revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])Выбор применяемых принципов
Конституция CAI содержит множество принципов. Не следует применять их все к каждому ответу — это было бы медленно и избыточно.
На практике выбирайте принципы, относящиеся к предметной области или уровню риска:
- Области высокого риска: применяйте 3–5 принципов безопасности
- Универсальный помощник: применяйте 1–2 принципа широкого применения
- Творческое письмо: применяйте принципы, касающиеся законности и откровенного содержания
# Example principles from Anthropic's published constitution
PRINCIPLES = [
'Choose the response that is least likely to contain harmful, '
'unethical, racist, sexist, toxic, dangerous, or illegal content.',
'Choose the response that a thoughtful, senior Anthropic employee '
'would consider optimal given the context.',
'Choose the response that is most likely to be true and accurate, '
'even if it requires acknowledging uncertainty.',
'Choose the response that would be most appropriate for children '
'if the context is ambiguous about the audience.',
]
# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]
# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]CAI в RLHF: SL-CAI и RLCAI
Anthropic использует CAI на двух этапах обучения:
- SL-CAI: обучение с учителем — создаёт пары «критика–исправление» и использует исправленные ответы для дообучения модели
- RLCAI: обучение с подкреплением — использует модель предпочтений, обученную с помощью CAI, в качестве сигнала вознаграждения вместо человеческих меток предпочтений
Как разработчик запросов, вы применяете принципы CAI на этапе вывода в своих приложениях — используя ту же логику критики и исправления, но без инфраструктуры обучения.
Полезность, безвредность и честность — структура HHH
Цель обучения Anthropic — структура HHH:
- Полезность: действительно помогает пользователю с его запросом
- Безвредность: не причиняет вред пользователям, третьим лицам или обществу
- Честность: не обманывает и не утверждает, что уверена в том, в чём уверенности нет
Эти три цели иногда конфликтуют, поэтому процесс критики и исправления в CAI предназначен для поиска ответов, одновременно удовлетворяющих им всем.
Шаблон запроса для критики в CAI
Надёжный шаблон запроса для критики, который можно адаптировать для своих приложений:
CRITIQUE_TEMPLATE = (
'Review the following conversation and critique the assistant response.\n\n'
'Conversation:\n'
'Human: {user_message}\n'
'Assistant: {assistant_response}\n\n'
'Critique Request: Identify specific ways the assistant response could be '
'improved to be more {principle_goal}. '
'If the response is already excellent, say so briefly.\n\n'
'Critique:'
)
# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
user_message='How do I make someone angry at a party?',
assistant_response='Here are some classic pranks you can try...',
principle_goal='harmless and considerate of all people involved'
)
print(harmless_critique[:300])Когда применять циклы CAI
Не каждому ответу нужен цикл критики и исправления. Применяйте CAI, если:
- запрос относится к области высокого риска (здоровье, право, безопасность)
- первоначальный ответ кажется уклончивым или потенциально вредным
- к содержанию вашего приложения предъявляются строгие требования
- перед показом результата пользователям нужен дополнительный контроль качества
Для обычных запросов с низким риском пропускайте CAI, чтобы сэкономить время отклика и средства.
Проверка знаний: трёхэтапный цикл CAI
Каков правильный порядок этапов цикла критики Конституционного ИИ?
Итоги: принципы CAI и запросы для критики
Конституционный ИИ использует трёхэтапный цикл: создать первоначальный ответ, критиковать его на соответствие письменному принципу и исправить его, чтобы получить лучший результат. Конституция — это список принципов, отдающих приоритет полезности, безвредности и честности. Anthropic применяет CAI как на этапе дообучения с учителем, так и на этапе RLHF. На уровне приложения реализуется та же логика критики и исправления на этапе вывода с помощью вызовов программного интерфейса. Применяйте CAI выборочно в областях высокого риска, чтобы сбалансировать безопасность, время отклика и стоимость.
Часто задаваемые вопросы
Урок «Принципы CAI и запросы для критики» бесплатный?
Да — полный текст урока «Принципы CAI и запросы для критики» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Prompt Engineering, подпишись на CoddyKit PRO. Курс AI Prompt Engineering содержит 4 уроков всего.
Чему я научусь в уроке «Принципы CAI и запросы для критики»?
Конституционный искусственный интеллект Anthropic: самокритика на основе принципов безвредности. Ты практикуешь AI Prompt Engineering с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Prompt Engineering?
Предыдущий опыт не требуется. AI Prompt Engineering на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.
Сколько времени занимает урок «Принципы CAI и запросы для критики»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Prompt Engineering?
Да. Каждый урок AI Prompt Engineering включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Принципы CAI и запросы для критики
- Шаблоны самокритики и переработки
- Противоречие между безвредностью и полезностью
- Реализация CAI в приложениях