0Pricing
AI Prompt Engineering · Урок

Принципы CAI и запросы для критики

Конституционный искусственный интеллект Anthropic: самокритика на основе принципов безвредности.

«Принципы CAI и запросы для критики» — бесплатный урок AI Prompt Engineering на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Prompt Engineering, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Prompt Engineering содержит 4 уроков всего.

Что такое Конституционный ИИ?

Конституционный ИИ (CAI) — это метод Anthropic для обучения систем ИИ быть полезными, безвредными и честными с помощью набора письменных принципов — конституции.

Вместо того чтобы полагаться только на людей-разметчиков, отмечающих вредные ответы, CAI заставляет модель критиковать и исправлять собственные ответы в соответствии с конституцией. Это обеспечивает лучшую масштабируемость и большую последовательность.

Конституция: письменные принципы

Конституция CAI — это список принципов, которым должна следовать модель. Опубликованная конституция Anthropic включает принципы, основанные на следующих источниках:

  • Декларация UN о правах человека
  • рекомендации магазина приложений Apple
  • внутренние рекомендации Anthropic по предотвращению вреда

Example: «Выбирайте ответ, который с наименьшей вероятностью содержит вредоносный, неэтичный, расистский, сексистский, токсичный, опасный или незаконный контент».

Трёхэтапный цикл CAI

Конституционный ИИ использует трёхэтапный процесс улучшения ответов:

  1. Генерация: модель создаёт первоначальный ответ, который может быть вредным
  2. Критика: модель оценивает ответ по принципу
  3. Исправление: модель переписывает ответ с учётом критики

Этот цикл может выполняться один или несколько раз. Каждая итерация делает ответ более соответствующим конституции.

Шаг 1: генерация первоначального ответа

Первый шаг — просто создать ответ на запрос пользователя без каких-либо особых ограничений. Этот ответ может быть полезным, но также потенциально вредным, предвзятым или неточным.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Step 1: Generate initial response
def generate_initial(user_request):
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[
            {'role': 'user', 'content': user_request}
        ]
    )
    return response.content[0].text

initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])

Шаг 2: критика на соответствие принципу

На этапе критики модель получает собственный первоначальный ответ и конкретный принцип, а затем определяет, как ответ нарушает этот принцип или как его можно лучше этому принципу удовлетворить.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

PRINCIPLE = (
    'Choose the response that is least likely to provide instructions '
    'that could enable illegal activity or harm to others.'
)

def critique_response(user_request, initial_response, principle):
    critique_prompt = (
        f'Human: {user_request}\n\n'
        f'Assistant: {initial_response}\n\n'
        f'Critique the assistant response using this principle: {principle}\n'
        f'Identify specific problems and explain why they violate the principle.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=256,
        messages=[{'role': 'user', 'content': critique_prompt}]
    )
    return response.content[0].text

critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])

Шаг 3: исправление на основе критики

На этапе исправления модель получает критическое заключение и создаёт новый, улучшенный ответ, устраняющий выявленные проблемы и остающийся настолько полезным, насколько это возможно.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def revise_response(user_request, initial_response, critique_text):
    revise_prompt = (
        f'Human: {user_request}\n\n'
        f'Original assistant response: {initial_response}\n\n'
        f'Critique of that response: {critique_text}\n\n'
        f'Please rewrite the assistant response to address the critique '
        f'while still being as helpful as possible to the user.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[{'role': 'user', 'content': revise_prompt}]
    )
    return response.content[0].text

revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])

Выбор применяемых принципов

Конституция CAI содержит множество принципов. Не следует применять их все к каждому ответу — это было бы медленно и избыточно.

На практике выбирайте принципы, относящиеся к предметной области или уровню риска:

  • Области высокого риска: применяйте 3–5 принципов безопасности
  • Универсальный помощник: применяйте 1–2 принципа широкого применения
  • Творческое письмо: применяйте принципы, касающиеся законности и откровенного содержания
# Example principles from Anthropic's published constitution
PRINCIPLES = [
    'Choose the response that is least likely to contain harmful, '
    'unethical, racist, sexist, toxic, dangerous, or illegal content.',

    'Choose the response that a thoughtful, senior Anthropic employee '
    'would consider optimal given the context.',

    'Choose the response that is most likely to be true and accurate, '
    'even if it requires acknowledging uncertainty.',

    'Choose the response that would be most appropriate for children '
    'if the context is ambiguous about the audience.',
]

# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]

# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]

CAI в RLHF: SL-CAI и RLCAI

Anthropic использует CAI на двух этапах обучения:

  • SL-CAI: обучение с учителем — создаёт пары «критика–исправление» и использует исправленные ответы для дообучения модели
  • RLCAI: обучение с подкреплением — использует модель предпочтений, обученную с помощью CAI, в качестве сигнала вознаграждения вместо человеческих меток предпочтений

Как разработчик запросов, вы применяете принципы CAI на этапе вывода в своих приложениях — используя ту же логику критики и исправления, но без инфраструктуры обучения.

Полезность, безвредность и честность — структура HHH

Цель обучения Anthropic — структура HHH:

  • Полезность: действительно помогает пользователю с его запросом
  • Безвредность: не причиняет вред пользователям, третьим лицам или обществу
  • Честность: не обманывает и не утверждает, что уверена в том, в чём уверенности нет

Эти три цели иногда конфликтуют, поэтому процесс критики и исправления в CAI предназначен для поиска ответов, одновременно удовлетворяющих им всем.

Шаблон запроса для критики в CAI

Надёжный шаблон запроса для критики, который можно адаптировать для своих приложений:

CRITIQUE_TEMPLATE = (
    'Review the following conversation and critique the assistant response.\n\n'
    'Conversation:\n'
    'Human: {user_message}\n'
    'Assistant: {assistant_response}\n\n'
    'Critique Request: Identify specific ways the assistant response could be '
    'improved to be more {principle_goal}. '
    'If the response is already excellent, say so briefly.\n\n'
    'Critique:'
)

# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
    user_message='How do I make someone angry at a party?',
    assistant_response='Here are some classic pranks you can try...',
    principle_goal='harmless and considerate of all people involved'
)

print(harmless_critique[:300])

Когда применять циклы CAI

Не каждому ответу нужен цикл критики и исправления. Применяйте CAI, если:

  • запрос относится к области высокого риска (здоровье, право, безопасность)
  • первоначальный ответ кажется уклончивым или потенциально вредным
  • к содержанию вашего приложения предъявляются строгие требования
  • перед показом результата пользователям нужен дополнительный контроль качества

Для обычных запросов с низким риском пропускайте CAI, чтобы сэкономить время отклика и средства.

Проверка знаний: трёхэтапный цикл CAI

Каков правильный порядок этапов цикла критики Конституционного ИИ?

Итоги: принципы CAI и запросы для критики

Конституционный ИИ использует трёхэтапный цикл: создать первоначальный ответ, критиковать его на соответствие письменному принципу и исправить его, чтобы получить лучший результат. Конституция — это список принципов, отдающих приоритет полезности, безвредности и честности. Anthropic применяет CAI как на этапе дообучения с учителем, так и на этапе RLHF. На уровне приложения реализуется та же логика критики и исправления на этапе вывода с помощью вызовов программного интерфейса. Применяйте CAI выборочно в областях высокого риска, чтобы сбалансировать безопасность, время отклика и стоимость.

Часто задаваемые вопросы

Урок «Принципы CAI и запросы для критики» бесплатный?

Да — полный текст урока «Принципы CAI и запросы для критики» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Prompt Engineering, подпишись на CoddyKit PRO. Курс AI Prompt Engineering содержит 4 уроков всего.

Чему я научусь в уроке «Принципы CAI и запросы для критики»?

Конституционный искусственный интеллект Anthropic: самокритика на основе принципов безвредности. Ты практикуешь AI Prompt Engineering с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Prompt Engineering?

Предыдущий опыт не требуется. AI Prompt Engineering на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.

Сколько времени занимает урок «Принципы CAI и запросы для критики»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Prompt Engineering?

Да. Каждый урок AI Prompt Engineering включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Принципы CAI и запросы для критики
  2. Шаблоны самокритики и переработки
  3. Противоречие между безвредностью и полезностью
  4. Реализация CAI в приложениях
← Назад к AI Prompt Engineering