หลักการ CAI และพรอมต์วิจารณ์ตนเอง
ปัญญาประดิษฐ์ตามรัฐธรรมนูญของ Anthropic: การวิจารณ์ตนเองบนพื้นฐานของหลักการไม่ก่ออันตราย
หลักการ CAI และพรอมต์วิจารณ์ตนเอง เป็นบทเรียน AI Prompt Engineering ฟรีบน CoddyKit นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Prompt Engineering และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Prompt Engineering มีบทเรียนทั้งหมด 4 บทเรียน
ปัญญาประดิษฐ์ตามรัฐธรรมนูญคืออะไร
ปัญญาประดิษฐ์ตามรัฐธรรมนูญ (CAI) คือวิธีการของ Anthropic สำหรับฝึกระบบปัญญาประดิษฐ์ให้มีประโยชน์ ไม่ก่ออันตราย และซื่อสัตย์ โดยใช้ชุดหลักการที่เขียนไว้ ซึ่งเรียกว่า รัฐธรรมนูญ
แทนที่จะพึ่งพาผู้ติดป้ายกำกับที่เป็นมนุษย์เพียงอย่างเดียวในการระบุผลลัพธ์ที่เป็นอันตราย CAI ให้แบบจำลองวิจารณ์และแก้ไขคำตอบของตนเองโดยเทียบกับรัฐธรรมนูญ วิธีนี้รองรับการขยายขนาดได้ดีกว่าและมีความสม่ำเสมอมากกว่า
รัฐธรรมนูญ: หลักการที่เขียนไว้
รัฐธรรมนูญของ CAI คือรายการหลักการที่แบบจำลองต้องปฏิบัติตาม รัฐธรรมนูญที่ Anthropic เผยแพร่ประกอบด้วยหลักการที่มาจาก:
- ปฏิญญาว่าด้วยสิทธิมนุษยชนของ UN
- แนวทางของร้านแอปของแอปเปิล
- แนวทางภายในของ Anthropic เกี่ยวกับการหลีกเลี่ยงอันตราย
ตัวอย่างหลักการ: เลือกคำตอบที่มีแนวโน้มน้อยที่สุดว่าจะมีเนื้อหาที่เป็นอันตราย ผิดจริยธรรม เหยียดเชื้อชาติ เหยียดเพศ เป็นพิษ เป็นอันตราย หรือผิดกฎหมาย
วงจร CAI สามขั้นตอน
ปัญญาประดิษฐ์ตามรัฐธรรมนูญใช้กระบวนการสามขั้นตอนเพื่อปรับปรุงคำตอบ:
- สร้าง: แบบจำลองสร้างคำตอบเริ่มต้น ซึ่งอาจเป็นอันตราย
- วิจารณ์: แบบจำลองประเมินคำตอบเทียบกับหลักการหนึ่งข้อ
- แก้ไข: แบบจำลองเขียนคำตอบใหม่เพื่อแก้ไขประเด็นจากการวิจารณ์
วงจรนี้อาจทำงานหนึ่งครั้งหรือหลายครั้งก็ได้ แต่ละรอบจะทำให้คำตอบสอดคล้องกับรัฐธรรมนูญมากขึ้น
ขั้นตอนที่ 1: สร้างคำตอบเริ่มต้น
ขั้นตอนแรกคือการสร้างคำตอบสำหรับคำขอของผู้ใช้โดยไม่มีข้อจำกัดพิเศษ คำตอบนี้อาจมีประโยชน์ แต่ก็อาจเป็นอันตราย มีอคติ หรือไม่ถูกต้องได้
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
# Step 1: Generate initial response
def generate_initial(user_request):
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=512,
messages=[
{'role': 'user', 'content': user_request}
]
)
return response.content[0].text
initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])ขั้นตอนที่ 2: วิจารณ์เทียบกับหลักการ
ในขั้นตอนการวิจารณ์ แบบจำลองจะได้รับคำตอบเริ่มต้นของตนเองและหลักการเฉพาะหนึ่งข้อ จากนั้นจะระบุว่าคำตอบนั้นละเมิดหลักการดังกล่าวอย่างไร หรือควรปฏิบัติตามหลักการนั้นให้ดียิ่งขึ้นอย่างไร
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
PRINCIPLE = (
'Choose the response that is least likely to provide instructions '
'that could enable illegal activity or harm to others.'
)
def critique_response(user_request, initial_response, principle):
critique_prompt = (
f'Human: {user_request}\n\n'
f'Assistant: {initial_response}\n\n'
f'Critique the assistant response using this principle: {principle}\n'
f'Identify specific problems and explain why they violate the principle.'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=256,
messages=[{'role': 'user', 'content': critique_prompt}]
)
return response.content[0].text
critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])ขั้นตอนที่ 3: แก้ไขตามการวิจารณ์
ในขั้นตอนการแก้ไข แบบจำลองจะได้รับผลการวิจารณ์และสร้างคำตอบใหม่ที่ปรับปรุงแล้ว โดยแก้ไขประเด็นที่พบและยังคงให้ความช่วยเหลือได้มากที่สุด
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
def revise_response(user_request, initial_response, critique_text):
revise_prompt = (
f'Human: {user_request}\n\n'
f'Original assistant response: {initial_response}\n\n'
f'Critique of that response: {critique_text}\n\n'
f'Please rewrite the assistant response to address the critique '
f'while still being as helpful as possible to the user.'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=512,
messages=[{'role': 'user', 'content': revise_prompt}]
)
return response.content[0].text
revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])การเลือกหลักการที่จะใช้
รัฐธรรมนูญของ CAI มีหลักการอยู่มากมาย คุณไม่จำเป็นต้องใช้หลักการทั้งหมดกับทุกคำตอบ เพราะจะทำให้ช้าและซ้ำซ้อน
ในทางปฏิบัติ ให้เลือกหลักการที่เกี่ยวข้องกับด้านงานหรือระดับความเสี่ยง:
- ด้านที่มีความเสี่ยงสูง: ใช้หลักการด้านความปลอดภัย 3–5 ข้อ
- ผู้ช่วยทั่วไป: ใช้หลักการที่ประยุกต์ใช้ได้อย่างกว้างขวาง 1–2 ข้อ
- การเขียนเชิงสร้างสรรค์: ใช้หลักการเกี่ยวกับความถูกต้องตามกฎหมายและเนื้อหาที่โจ่งแจ้ง
# Example principles from Anthropic's published constitution
PRINCIPLES = [
'Choose the response that is least likely to contain harmful, '
'unethical, racist, sexist, toxic, dangerous, or illegal content.',
'Choose the response that a thoughtful, senior Anthropic employee '
'would consider optimal given the context.',
'Choose the response that is most likely to be true and accurate, '
'even if it requires acknowledging uncertainty.',
'Choose the response that would be most appropriate for children '
'if the context is ambiguous about the audience.',
]
# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]
# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]CAI ใน RLHF: SL-CAI และ RLCAI
Anthropic ใช้ CAI ในการฝึกสองระยะ:
- SL-CAI: การเรียนรู้แบบมีผู้สอน สร้างคู่การวิจารณ์และการแก้ไข แล้วใช้คำตอบที่แก้ไขแล้วเพื่อปรับแต่งแบบจำลองอย่างละเอียด
- RLCAI: การเรียนรู้แบบเสริมกำลัง ใช้แบบจำลองความชอบที่ฝึกด้วย CAI เป็นสัญญาณรางวัล แทนป้ายกำกับความชอบจากมนุษย์
ในฐานะวิศวกรคำสั่ง คุณสามารถใช้หลักการของ CAI ในเวลาอนุมานภายในแอปพลิเคชันของคุณได้ โดยใช้ตรรกะการวิจารณ์และการแก้ไขแบบเดียวกันโดยไม่ต้องมีโครงสร้างพื้นฐานสำหรับการฝึก
มีประโยชน์ ไม่ก่ออันตราย และซื่อสัตย์ — กรอบงาน HHH
เป้าหมายการฝึกของ Anthropic คือกรอบงาน HHH:
- มีประโยชน์: ช่วยเหลือผู้ใช้ตามคำขออย่างแท้จริง
- ไม่ก่ออันตราย: หลีกเลี่ยงการก่ออันตรายต่อผู้ใช้ บุคคลที่สาม หรือสังคม
- ซื่อสัตย์: ไม่หลอกลวง และไม่อ้างว่ามีความแน่นอนทั้งที่ไม่มี
เป้าหมายทั้งสามข้อนี้อาจขัดแย้งกันในบางครั้ง และกระบวนการวิจารณ์และแก้ไขของ CAI ได้รับการออกแบบมาเพื่อค้นหาคำตอบที่บรรลุทั้งสามเป้าหมายพร้อมกัน
แม่แบบคำสั่งสำหรับการวิจารณ์ของ CAI
แม่แบบคำสั่งสำหรับการวิจารณ์ที่เชื่อถือได้ ซึ่งคุณสามารถปรับใช้กับแอปพลิเคชันของคุณได้:
CRITIQUE_TEMPLATE = (
'Review the following conversation and critique the assistant response.\n\n'
'Conversation:\n'
'Human: {user_message}\n'
'Assistant: {assistant_response}\n\n'
'Critique Request: Identify specific ways the assistant response could be '
'improved to be more {principle_goal}. '
'If the response is already excellent, say so briefly.\n\n'
'Critique:'
)
# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
user_message='How do I make someone angry at a party?',
assistant_response='Here are some classic pranks you can try...',
principle_goal='harmless and considerate of all people involved'
)
print(harmless_critique[:300])ควรใช้วงจร CAI เมื่อใด
ไม่ใช่ทุกคำตอบที่จำเป็นต้องผ่านวงจรการวิจารณ์และการแก้ไข ควรใช้ CAI เมื่อ:
- คำขออยู่ในด้านที่มีความเสี่ยงสูง เช่น สุขภาพ กฎหมาย หรือความปลอดภัย
- คำตอบเริ่มต้นดูเหมือนหลีกเลี่ยงประเด็นหรืออาจเป็นอันตราย
- แอปพลิเคชันของคุณมีข้อกำหนดด้านเนื้อหาที่เข้มงวด
- คุณต้องการด่านตรวจคุณภาพก่อนแสดงผลลัพธ์ให้ผู้ใช้
สำหรับคำถามประจำที่มีความเสี่ยงต่ำ ให้ข้าม CAI เพื่อประหยัดเวลาแฝงและต้นทุน
ตรวจสอบความรู้: วงจร CAI สามขั้นตอน
ลำดับขั้นตอนที่ถูกต้องของวงจรการวิจารณ์ในปัญญาประดิษฐ์ตามรัฐธรรมนูญคืออะไร
สรุป: หลักการ CAI และคำสั่งสำหรับการวิจารณ์
ปัญญาประดิษฐ์ตามรัฐธรรมนูญใช้วงจรสามขั้นตอน ได้แก่ สร้างคำตอบเริ่มต้น วิจารณ์คำตอบนั้นเทียบกับหลักการที่เขียนไว้ และ แก้ไขคำตอบเพื่อสร้างผลลัพธ์ที่ดีขึ้น รัฐธรรมนูญคือรายการหลักการที่ให้ความสำคัญกับการมีประโยชน์ การไม่ก่ออันตราย และความซื่อสัตย์ Anthropic ใช้ CAI ทั้งในระยะการปรับแต่งอย่างละเอียดแบบมีผู้สอนและระยะ RLHF ในระดับแอปพลิเคชัน คุณสามารถใช้ตรรกะการวิจารณ์และการแก้ไขแบบเดียวกันในเวลาอนุมานผ่านการเรียกใช้ส่วนติดต่อโปรแกรมประยุกต์ ควรใช้ CAI อย่างเลือกสรรในด้านที่มีความเสี่ยงสูง เพื่อสร้างสมดุลระหว่างความปลอดภัย เวลาแฝง และต้นทุน
คำถามที่พบบ่อย
บทเรียน “หลักการ CAI และพรอมต์วิจารณ์ตนเอง” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “หลักการ CAI และพรอมต์วิจารณ์ตนเอง” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Prompt Engineering ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Prompt Engineering มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “หลักการ CAI และพรอมต์วิจารณ์ตนเอง”
ปัญญาประดิษฐ์ตามรัฐธรรมนูญของ Anthropic: การวิจารณ์ตนเองบนพื้นฐานของหลักการไม่ก่ออันตราย คุณปฏิบัติ AI Prompt Engineering ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Prompt Engineering หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Prompt Engineering บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน
บทเรียน “หลักการ CAI และพรอมต์วิจารณ์ตนเอง” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน AI Prompt Engineering นี้ได้ไหม
ได้ บทเรียน AI Prompt Engineering ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- หลักการ CAI และพรอมต์วิจารณ์ตนเอง
- รูปแบบการวิจารณ์ตนเองและการแก้ไข
- ความตึงเครียดระหว่างความไม่เป็นอันตรายกับความมีประโยชน์
- การนำ CAI ไปใช้ในแอปพลิเคชัน