0Pricing
AI Prompt Engineering · บทเรียน

หลักการ CAI และพรอมต์วิจารณ์ตนเอง

ปัญญาประดิษฐ์ตามรัฐธรรมนูญของ Anthropic: การวิจารณ์ตนเองบนพื้นฐานของหลักการไม่ก่ออันตราย

หลักการ CAI และพรอมต์วิจารณ์ตนเอง เป็นบทเรียน AI Prompt Engineering ฟรีบน CoddyKit นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Prompt Engineering และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Prompt Engineering มีบทเรียนทั้งหมด 4 บทเรียน

ปัญญาประดิษฐ์ตามรัฐธรรมนูญคืออะไร

ปัญญาประดิษฐ์ตามรัฐธรรมนูญ (CAI) คือวิธีการของ Anthropic สำหรับฝึกระบบปัญญาประดิษฐ์ให้มีประโยชน์ ไม่ก่ออันตราย และซื่อสัตย์ โดยใช้ชุดหลักการที่เขียนไว้ ซึ่งเรียกว่า รัฐธรรมนูญ

แทนที่จะพึ่งพาผู้ติดป้ายกำกับที่เป็นมนุษย์เพียงอย่างเดียวในการระบุผลลัพธ์ที่เป็นอันตราย CAI ให้แบบจำลองวิจารณ์และแก้ไขคำตอบของตนเองโดยเทียบกับรัฐธรรมนูญ วิธีนี้รองรับการขยายขนาดได้ดีกว่าและมีความสม่ำเสมอมากกว่า

รัฐธรรมนูญ: หลักการที่เขียนไว้

รัฐธรรมนูญของ CAI คือรายการหลักการที่แบบจำลองต้องปฏิบัติตาม รัฐธรรมนูญที่ Anthropic เผยแพร่ประกอบด้วยหลักการที่มาจาก:

  • ปฏิญญาว่าด้วยสิทธิมนุษยชนของ UN
  • แนวทางของร้านแอปของแอปเปิล
  • แนวทางภายในของ Anthropic เกี่ยวกับการหลีกเลี่ยงอันตราย

ตัวอย่างหลักการ: เลือกคำตอบที่มีแนวโน้มน้อยที่สุดว่าจะมีเนื้อหาที่เป็นอันตราย ผิดจริยธรรม เหยียดเชื้อชาติ เหยียดเพศ เป็นพิษ เป็นอันตราย หรือผิดกฎหมาย

วงจร CAI สามขั้นตอน

ปัญญาประดิษฐ์ตามรัฐธรรมนูญใช้กระบวนการสามขั้นตอนเพื่อปรับปรุงคำตอบ:

  1. สร้าง: แบบจำลองสร้างคำตอบเริ่มต้น ซึ่งอาจเป็นอันตราย
  2. วิจารณ์: แบบจำลองประเมินคำตอบเทียบกับหลักการหนึ่งข้อ
  3. แก้ไข: แบบจำลองเขียนคำตอบใหม่เพื่อแก้ไขประเด็นจากการวิจารณ์

วงจรนี้อาจทำงานหนึ่งครั้งหรือหลายครั้งก็ได้ แต่ละรอบจะทำให้คำตอบสอดคล้องกับรัฐธรรมนูญมากขึ้น

ขั้นตอนที่ 1: สร้างคำตอบเริ่มต้น

ขั้นตอนแรกคือการสร้างคำตอบสำหรับคำขอของผู้ใช้โดยไม่มีข้อจำกัดพิเศษ คำตอบนี้อาจมีประโยชน์ แต่ก็อาจเป็นอันตราย มีอคติ หรือไม่ถูกต้องได้

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Step 1: Generate initial response
def generate_initial(user_request):
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[
            {'role': 'user', 'content': user_request}
        ]
    )
    return response.content[0].text

initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])

ขั้นตอนที่ 2: วิจารณ์เทียบกับหลักการ

ในขั้นตอนการวิจารณ์ แบบจำลองจะได้รับคำตอบเริ่มต้นของตนเองและหลักการเฉพาะหนึ่งข้อ จากนั้นจะระบุว่าคำตอบนั้นละเมิดหลักการดังกล่าวอย่างไร หรือควรปฏิบัติตามหลักการนั้นให้ดียิ่งขึ้นอย่างไร

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

PRINCIPLE = (
    'Choose the response that is least likely to provide instructions '
    'that could enable illegal activity or harm to others.'
)

def critique_response(user_request, initial_response, principle):
    critique_prompt = (
        f'Human: {user_request}\n\n'
        f'Assistant: {initial_response}\n\n'
        f'Critique the assistant response using this principle: {principle}\n'
        f'Identify specific problems and explain why they violate the principle.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=256,
        messages=[{'role': 'user', 'content': critique_prompt}]
    )
    return response.content[0].text

critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])

ขั้นตอนที่ 3: แก้ไขตามการวิจารณ์

ในขั้นตอนการแก้ไข แบบจำลองจะได้รับผลการวิจารณ์และสร้างคำตอบใหม่ที่ปรับปรุงแล้ว โดยแก้ไขประเด็นที่พบและยังคงให้ความช่วยเหลือได้มากที่สุด

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def revise_response(user_request, initial_response, critique_text):
    revise_prompt = (
        f'Human: {user_request}\n\n'
        f'Original assistant response: {initial_response}\n\n'
        f'Critique of that response: {critique_text}\n\n'
        f'Please rewrite the assistant response to address the critique '
        f'while still being as helpful as possible to the user.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[{'role': 'user', 'content': revise_prompt}]
    )
    return response.content[0].text

revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])

การเลือกหลักการที่จะใช้

รัฐธรรมนูญของ CAI มีหลักการอยู่มากมาย คุณไม่จำเป็นต้องใช้หลักการทั้งหมดกับทุกคำตอบ เพราะจะทำให้ช้าและซ้ำซ้อน

ในทางปฏิบัติ ให้เลือกหลักการที่เกี่ยวข้องกับด้านงานหรือระดับความเสี่ยง:

  • ด้านที่มีความเสี่ยงสูง: ใช้หลักการด้านความปลอดภัย 3–5 ข้อ
  • ผู้ช่วยทั่วไป: ใช้หลักการที่ประยุกต์ใช้ได้อย่างกว้างขวาง 1–2 ข้อ
  • การเขียนเชิงสร้างสรรค์: ใช้หลักการเกี่ยวกับความถูกต้องตามกฎหมายและเนื้อหาที่โจ่งแจ้ง
# Example principles from Anthropic's published constitution
PRINCIPLES = [
    'Choose the response that is least likely to contain harmful, '
    'unethical, racist, sexist, toxic, dangerous, or illegal content.',

    'Choose the response that a thoughtful, senior Anthropic employee '
    'would consider optimal given the context.',

    'Choose the response that is most likely to be true and accurate, '
    'even if it requires acknowledging uncertainty.',

    'Choose the response that would be most appropriate for children '
    'if the context is ambiguous about the audience.',
]

# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]

# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]

CAI ใน RLHF: SL-CAI และ RLCAI

Anthropic ใช้ CAI ในการฝึกสองระยะ:

  • SL-CAI: การเรียนรู้แบบมีผู้สอน สร้างคู่การวิจารณ์และการแก้ไข แล้วใช้คำตอบที่แก้ไขแล้วเพื่อปรับแต่งแบบจำลองอย่างละเอียด
  • RLCAI: การเรียนรู้แบบเสริมกำลัง ใช้แบบจำลองความชอบที่ฝึกด้วย CAI เป็นสัญญาณรางวัล แทนป้ายกำกับความชอบจากมนุษย์

ในฐานะวิศวกรคำสั่ง คุณสามารถใช้หลักการของ CAI ในเวลาอนุมานภายในแอปพลิเคชันของคุณได้ โดยใช้ตรรกะการวิจารณ์และการแก้ไขแบบเดียวกันโดยไม่ต้องมีโครงสร้างพื้นฐานสำหรับการฝึก

มีประโยชน์ ไม่ก่ออันตราย และซื่อสัตย์ — กรอบงาน HHH

เป้าหมายการฝึกของ Anthropic คือกรอบงาน HHH:

  • มีประโยชน์: ช่วยเหลือผู้ใช้ตามคำขออย่างแท้จริง
  • ไม่ก่ออันตราย: หลีกเลี่ยงการก่ออันตรายต่อผู้ใช้ บุคคลที่สาม หรือสังคม
  • ซื่อสัตย์: ไม่หลอกลวง และไม่อ้างว่ามีความแน่นอนทั้งที่ไม่มี

เป้าหมายทั้งสามข้อนี้อาจขัดแย้งกันในบางครั้ง และกระบวนการวิจารณ์และแก้ไขของ CAI ได้รับการออกแบบมาเพื่อค้นหาคำตอบที่บรรลุทั้งสามเป้าหมายพร้อมกัน

แม่แบบคำสั่งสำหรับการวิจารณ์ของ CAI

แม่แบบคำสั่งสำหรับการวิจารณ์ที่เชื่อถือได้ ซึ่งคุณสามารถปรับใช้กับแอปพลิเคชันของคุณได้:

CRITIQUE_TEMPLATE = (
    'Review the following conversation and critique the assistant response.\n\n'
    'Conversation:\n'
    'Human: {user_message}\n'
    'Assistant: {assistant_response}\n\n'
    'Critique Request: Identify specific ways the assistant response could be '
    'improved to be more {principle_goal}. '
    'If the response is already excellent, say so briefly.\n\n'
    'Critique:'
)

# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
    user_message='How do I make someone angry at a party?',
    assistant_response='Here are some classic pranks you can try...',
    principle_goal='harmless and considerate of all people involved'
)

print(harmless_critique[:300])

ควรใช้วงจร CAI เมื่อใด

ไม่ใช่ทุกคำตอบที่จำเป็นต้องผ่านวงจรการวิจารณ์และการแก้ไข ควรใช้ CAI เมื่อ:

  • คำขออยู่ในด้านที่มีความเสี่ยงสูง เช่น สุขภาพ กฎหมาย หรือความปลอดภัย
  • คำตอบเริ่มต้นดูเหมือนหลีกเลี่ยงประเด็นหรืออาจเป็นอันตราย
  • แอปพลิเคชันของคุณมีข้อกำหนดด้านเนื้อหาที่เข้มงวด
  • คุณต้องการด่านตรวจคุณภาพก่อนแสดงผลลัพธ์ให้ผู้ใช้

สำหรับคำถามประจำที่มีความเสี่ยงต่ำ ให้ข้าม CAI เพื่อประหยัดเวลาแฝงและต้นทุน

ตรวจสอบความรู้: วงจร CAI สามขั้นตอน

ลำดับขั้นตอนที่ถูกต้องของวงจรการวิจารณ์ในปัญญาประดิษฐ์ตามรัฐธรรมนูญคืออะไร

สรุป: หลักการ CAI และคำสั่งสำหรับการวิจารณ์

ปัญญาประดิษฐ์ตามรัฐธรรมนูญใช้วงจรสามขั้นตอน ได้แก่ สร้างคำตอบเริ่มต้น วิจารณ์คำตอบนั้นเทียบกับหลักการที่เขียนไว้ และ แก้ไขคำตอบเพื่อสร้างผลลัพธ์ที่ดีขึ้น รัฐธรรมนูญคือรายการหลักการที่ให้ความสำคัญกับการมีประโยชน์ การไม่ก่ออันตราย และความซื่อสัตย์ Anthropic ใช้ CAI ทั้งในระยะการปรับแต่งอย่างละเอียดแบบมีผู้สอนและระยะ RLHF ในระดับแอปพลิเคชัน คุณสามารถใช้ตรรกะการวิจารณ์และการแก้ไขแบบเดียวกันในเวลาอนุมานผ่านการเรียกใช้ส่วนติดต่อโปรแกรมประยุกต์ ควรใช้ CAI อย่างเลือกสรรในด้านที่มีความเสี่ยงสูง เพื่อสร้างสมดุลระหว่างความปลอดภัย เวลาแฝง และต้นทุน

คำถามที่พบบ่อย

บทเรียน “หลักการ CAI และพรอมต์วิจารณ์ตนเอง” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “หลักการ CAI และพรอมต์วิจารณ์ตนเอง” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Prompt Engineering ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Prompt Engineering มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “หลักการ CAI และพรอมต์วิจารณ์ตนเอง”

ปัญญาประดิษฐ์ตามรัฐธรรมนูญของ Anthropic: การวิจารณ์ตนเองบนพื้นฐานของหลักการไม่ก่ออันตราย คุณปฏิบัติ AI Prompt Engineering ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Prompt Engineering หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Prompt Engineering บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน

บทเรียน “หลักการ CAI และพรอมต์วิจารณ์ตนเอง” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Prompt Engineering นี้ได้ไหม

ได้ บทเรียน AI Prompt Engineering ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. หลักการ CAI และพรอมต์วิจารณ์ตนเอง
  2. รูปแบบการวิจารณ์ตนเองและการแก้ไข
  3. ความตึงเครียดระหว่างความไม่เป็นอันตรายกับความมีประโยชน์
  4. การนำ CAI ไปใช้ในแอปพลิเคชัน
← กลับไปที่ AI Prompt Engineering