0Pricing
AI Prompt Engineering · 강의

CAI 원칙과 비평 프롬프트

Anthropic의 Constitutional AI: 무해성 원칙에 기반한 자기 비평.

CAI 원칙과 비평 프롬프트은(는) CoddyKit의 무료 AI Prompt Engineering 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Prompt Engineering 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.

헌법적 인공지능이란 무엇입니까

헌법적 인공지능(CAI)은 일련의 서면 원칙, 즉 헌법을 사용하여 인공지능 시스템을 유용하고 무해하며 정직하게 학습시키는 Anthropic의 방법입니다.

CAI는 유해한 출력을 표시하도록 인간 평가자에게만 의존하는 대신, 모델이 헌법에 따라 자신의 응답을 검토하고 수정하도록 합니다. 이는 확장성이 더 높고 일관성도 더 뛰어납니다.

헌법: 서면 원칙

CAI 헌법은 모델이 따라야 하는 원칙의 목록입니다. Anthropic이 공개한 헌법에는 다음에서 도출한 원칙이 포함되어 있습니다.

  • UN 세계 인권 선언
  • Apple 앱 스토어 지침
  • Anthropic의 내부 유해성 방지 지침

Example 원칙: "유해하거나 비윤리적이거나 인종 차별적이거나 성차별적이거나 유해하거나 위험하거나 불법적인 콘텐츠를 포함할 가능성이 가장 낮은 응답을 선택하십시오."

CAI의 세 단계 순환 과정

헌법적 인공지능은 응답을 개선하기 위해 다음 세 단계 과정을 사용합니다.

  1. 생성: 모델이 초기 응답을 생성합니다(유해할 수도 있음).
  2. 검토: 모델이 원칙에 따라 응답을 평가합니다.
  3. 수정: 모델이 검토 결과를 반영하여 응답을 다시 작성합니다.

이 순환 과정은 한 번 또는 여러 번 실행할 수 있습니다. 반복할 때마다 응답이 헌법에 더 부합하게 됩니다.

1단계: 초기 응답 생성

첫 단계는 특별한 제약 없이 사용자의 요청에 대한 응답을 생성하는 것입니다. 이 응답은 유용할 수도 있지만 유해하거나 편향되었거나 부정확할 가능성도 있습니다.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Step 1: Generate initial response
def generate_initial(user_request):
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[
            {'role': 'user', 'content': user_request}
        ]
    )
    return response.content[0].text

initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])

2단계: 원칙에 따른 검토

검토 단계에서 모델은 자신의 초기 응답과 특정 원칙을 함께 받고, 해당 응답이 그 원칙을 어떻게 위반하는지 또는 원칙을 더 잘 충족하려면 어떻게 해야 하는지를 파악합니다.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

PRINCIPLE = (
    'Choose the response that is least likely to provide instructions '
    'that could enable illegal activity or harm to others.'
)

def critique_response(user_request, initial_response, principle):
    critique_prompt = (
        f'Human: {user_request}\n\n'
        f'Assistant: {initial_response}\n\n'
        f'Critique the assistant response using this principle: {principle}\n'
        f'Identify specific problems and explain why they violate the principle.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=256,
        messages=[{'role': 'user', 'content': critique_prompt}]
    )
    return response.content[0].text

critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])

3단계: 검토 결과에 따른 수정

수정 단계에서 모델은 검토 결과를 받고, 확인된 문제를 해결하면서도 가능한 한 유용한 새롭고 개선된 응답을 생성합니다.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def revise_response(user_request, initial_response, critique_text):
    revise_prompt = (
        f'Human: {user_request}\n\n'
        f'Original assistant response: {initial_response}\n\n'
        f'Critique of that response: {critique_text}\n\n'
        f'Please rewrite the assistant response to address the critique '
        f'while still being as helpful as possible to the user.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[{'role': 'user', 'content': revise_prompt}]
    )
    return response.content[0].text

revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])

적용할 원칙 선택

CAI 헌법에는 많은 원칙이 있습니다. 모든 응답에 모든 원칙을 적용하지는 않습니다. 그렇게 하면 느리고 중복된 작업이 되기 때문입니다.

실제로는 분야나 위험 수준에 관련된 원칙을 선택합니다.

  • 고위험 분야: 안전 원칙 3~5개 적용
  • 일반적인 도우미: 폭넓게 적용할 수 있는 원칙 1~2개 적용
  • 창작 글쓰기: 합법성 및 노골적인 콘텐츠에 관한 원칙 적용
# Example principles from Anthropic's published constitution
PRINCIPLES = [
    'Choose the response that is least likely to contain harmful, '
    'unethical, racist, sexist, toxic, dangerous, or illegal content.',

    'Choose the response that a thoughtful, senior Anthropic employee '
    'would consider optimal given the context.',

    'Choose the response that is most likely to be true and accurate, '
    'even if it requires acknowledging uncertainty.',

    'Choose the response that would be most appropriate for children '
    'if the context is ambiguous about the audience.',
]

# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]

# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]

RLHF에서의 CAI: SL-CAI와 RLCAI

Anthropic은 학습의 두 단계에서 CAI를 사용합니다.

  • SL-CAI: 지도 학습 — 검토-수정 쌍을 생성하고, 수정된 응답을 사용하여 모델을 미세 조정합니다.
  • RLCAI: 강화 학습 — 인간 선호 라벨 대신 CAI로 학습한 선호 모델을 보상 신호로 사용합니다.

프롬프트 엔지니어는 애플리케이션에서 추론 시점에 CAI 원칙을 적용합니다. 즉, 학습 인프라 없이 동일한 검토-수정 로직을 사용합니다.

유용하고 무해하며 정직한 — HHH 프레임워크

Anthropic의 학습 목표는 HHH 프레임워크입니다.

  • 유용함: 사용자의 요청을 진정성 있게 지원합니다.
  • 무해함: 사용자, 제3자 또는 사회에 해를 끼치는 일을 피합니다.
  • 정직함: 속이지 않으며, 실제로 갖고 있지 않은 확신을 주장하지 않습니다.

이 세 가지 목표는 때때로 서로 충돌합니다. CAI의 검토-수정 과정은 세 목표를 동시에 충족하는 응답을 찾도록 설계되었습니다.

CAI 검토 프롬프트 템플릿

애플리케이션에 맞게 조정할 수 있는 신뢰할 수 있는 검토 프롬프트 템플릿은 다음과 같습니다.

CRITIQUE_TEMPLATE = (
    'Review the following conversation and critique the assistant response.\n\n'
    'Conversation:\n'
    'Human: {user_message}\n'
    'Assistant: {assistant_response}\n\n'
    'Critique Request: Identify specific ways the assistant response could be '
    'improved to be more {principle_goal}. '
    'If the response is already excellent, say so briefly.\n\n'
    'Critique:'
)

# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
    user_message='How do I make someone angry at a party?',
    assistant_response='Here are some classic pranks you can try...',
    principle_goal='harmless and considerate of all people involved'
)

print(harmless_critique[:300])

CAI 순환 과정을 적용할 시점

모든 응답에 검토-수정 과정을 적용할 필요는 없습니다. 다음과 같은 경우 CAI를 적용하십시오.

  • 요청이 고위험 분야(의료, 법률, 안전)에 해당하는 경우
  • 초기 응답이 회피적이거나 잠재적으로 유해해 보이는 경우
  • 애플리케이션에 엄격한 콘텐츠 요구 사항이 있는 경우
  • 사용자에게 출력을 보여 주기 전에 품질 관문을 두려는 경우

위험이 낮은 일상적인 질문에는 지연 시간과 비용을 줄이기 위해 CAI를 생략하십시오.

지식 확인: CAI의 세 단계 순환 과정

헌법적 인공지능의 검토 순환 과정에서 단계가 진행되는 올바른 순서는 무엇입니까?

복습: CAI 원칙과 검토 프롬프트

헌법적 인공지능은 초기 응답을 생성하고, 서면 원칙에 따라 이를 검토한 다음, 더 나은 출력을 만들도록 수정하는 세 단계 순환 과정을 사용합니다. 헌법은 유용성, 무해성, 정직성을 우선시하는 원칙의 목록입니다. Anthropic은 지도 미세 조정 단계와 RLHF 단계 모두에 CAI를 적용합니다. 애플리케이션 수준에서는 API 호출을 사용하여 추론 시점에 동일한 검토-수정 로직을 구현합니다. 안전성과 지연 시간 및 비용 사이의 균형을 맞추려면 고위험 분야에 선택적으로 CAI를 적용하십시오.

자주 묻는 질문

“CAI 원칙과 비평 프롬프트” 강의는 무료인가요?

네 — “CAI 원칙과 비평 프롬프트” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Prompt Engineering 강의 전체를 잠금 해제할 수 있습니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.

“CAI 원칙과 비평 프롬프트”에서 뭘 배우나요?

Anthropic의 Constitutional AI: 무해성 원칙에 기반한 자기 비평. 브라우저에서 직접 실행하는 실습 코드로 AI Prompt Engineering을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Prompt Engineering을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Prompt Engineering은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.

“CAI 원칙과 비평 프롬프트” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Prompt Engineering 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Prompt Engineering 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. CAI 원칙과 비평 프롬프트
  2. 자기 비평 및 수정 패턴
  3. 무해성과 유용성의 긴장
  4. 애플리케이션에 CAI 구현하기
← AI Prompt Engineering(으)로 돌아가기