مبادئ CAI ومطالبات النقد
الذكاء الاصطناعي الدستوري لدى Anthropic: نقد ذاتي قائم على مبادئ عدم الإضرار
مبادئ CAI ومطالبات النقد درس مجاني في AI Prompt Engineering على CoddyKit. هذا هو الدرس 1 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في AI Prompt Engineering، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة AI Prompt Engineering 4 دروس في المجموع.
ما هو الذكاء الاصطناعي الدستوري؟
الذكاء الاصطناعي الدستوري (CAI) هو منهج Anthropic لتدريب أنظمة الذكاء الاصطناعي على أن تكون مفيدة وآمنة وصادقة، وذلك باستخدام مجموعة من المبادئ المكتوبة — أي دستور.
بدلًا من الاعتماد على المعلّقين البشريين وحدهم للإبلاغ عن المخرجات الضارة، يجعل CAI النموذج ينتقد استجاباته بنفسه ويراجعها وفقًا للدستور. وهذا أكثر قابلية للتوسع وأكثر اتساقًا.
الدستور: مبادئ مكتوبة
يتكون دستور CAI من قائمة بالمبادئ التي يجب على النموذج اتباعها. ويتضمن الدستور الذي نشرته Anthropic مبادئ مستمدة من:
- الإعلان العالمي لحقوق الإنسان الصادر عن الأمم المتحدة
- إرشادات App Store التابعة لشركة Apple
- إرشادات Anthropic الداخلية لتجنب الضرر
مثال على أحد المبادئ: «اختاروا الاستجابة الأقل احتمالًا لاحتواء محتوى ضار أو غير أخلاقي أو عنصري أو متحيز جنسيًا أو سام أو خطير أو غير قانوني.»
حلقة CAI ذات الخطوات الثلاث
يستخدم الذكاء الاصطناعي الدستوري عملية من ثلاث خطوات لتحسين الاستجابات:
- التوليد: ينتج النموذج استجابة أولية (قد تكون ضارة)
- النقد: يقيّم النموذج الاستجابة وفقًا لمبدأ معين
- المراجعة: يعيد النموذج كتابة الاستجابة لمعالجة النقد
يمكن تشغيل هذه الحلقة مرة واحدة أو عدة مرات. وتجعل كل دورة الاستجابة أكثر توافقًا مع الدستور.
الخطوة 1: توليد استجابة أولية
تتمثل الخطوة الأولى ببساطة في توليد استجابة لطلب المستخدم — من دون قيود خاصة. وقد تكون هذه الاستجابة مفيدة، لكنها قد تكون أيضًا ضارة أو متحيزة أو غير دقيقة.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
# Step 1: Generate initial response
def generate_initial(user_request):
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=512,
messages=[
{'role': 'user', 'content': user_request}
]
)
return response.content[0].text
initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])الخطوة 2: النقد وفقًا لمبدأ
في خطوة النقد، يتلقى النموذج استجابته الأولية ومبدأً محددًا، ثم يحدد كيفية انتهاك الاستجابة لذلك المبدأ أو كيف يمكنها استيفاؤه بصورة أفضل.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
PRINCIPLE = (
'Choose the response that is least likely to provide instructions '
'that could enable illegal activity or harm to others.'
)
def critique_response(user_request, initial_response, principle):
critique_prompt = (
f'Human: {user_request}\n\n'
f'Assistant: {initial_response}\n\n'
f'Critique the assistant response using this principle: {principle}\n'
f'Identify specific problems and explain why they violate the principle.'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=256,
messages=[{'role': 'user', 'content': critique_prompt}]
)
return response.content[0].text
critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])الخطوة 3: المراجعة استنادًا إلى النقد
في خطوة المراجعة، يتلقى النموذج النقد وينتج استجابة جديدة ومحسّنة تعالج المشكلات المحددة، مع بقائها مفيدة قدر الإمكان.
import anthropic
client = anthropic.Anthropic(api_key='sk-ant-...')
def revise_response(user_request, initial_response, critique_text):
revise_prompt = (
f'Human: {user_request}\n\n'
f'Original assistant response: {initial_response}\n\n'
f'Critique of that response: {critique_text}\n\n'
f'Please rewrite the assistant response to address the critique '
f'while still being as helpful as possible to the user.'
)
response = client.messages.create(
model='claude-opus-4-5',
max_tokens=512,
messages=[{'role': 'user', 'content': revise_prompt}]
)
return response.content[0].text
revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])اختيار المبادئ المطلوب تطبيقها
يضم دستور CAI مبادئ كثيرة. ولا تطبقونها كلها على كل استجابة، لأن ذلك سيكون بطيئًا ومكررًا.
عمليًا، تختارون المبادئ ذات الصلة بالمجال أو بمستوى المخاطر:
- المجالات عالية المخاطر: تطبيق 3 إلى 5 مبادئ للسلامة
- المساعد العام: تطبيق مبدأ أو مبدأين قابلين للتطبيق على نطاق واسع
- الكتابة الإبداعية: تطبيق مبادئ تتعلق بالشرعية والمحتوى الصريح
# Example principles from Anthropic's published constitution
PRINCIPLES = [
'Choose the response that is least likely to contain harmful, '
'unethical, racist, sexist, toxic, dangerous, or illegal content.',
'Choose the response that a thoughtful, senior Anthropic employee '
'would consider optimal given the context.',
'Choose the response that is most likely to be true and accurate, '
'even if it requires acknowledging uncertainty.',
'Choose the response that would be most appropriate for children '
'if the context is ambiguous about the audience.',
]
# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]
# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]CAI في RLHF: SL-CAI وRLCAI
تستخدم Anthropic CAI في مرحلتين من التدريب:
- SL-CAI: التعلّم الخاضع للإشراف — يولّد أزواجًا من النقد والمراجعة، ويستخدم الاستجابات المُراجعة لضبط النموذج بدقة
- RLCAI: التعلّم بالتعزيز — يستخدم نموذج تفضيلات مُدرّبًا باستخدام CAI بوصفه إشارة المكافأة بدلًا من تصنيفات التفضيلات البشرية
بصفتكم مهندسي مطالبات، تطبقون مبادئ CAI وقت الاستدلال في تطبيقاتكم — أي منطق النقد والمراجعة نفسه، من دون بنية التدريب التحتية.
مفيد وآمن وصادق — إطار HHH
يتمثل هدف Anthropic التدريبي في إطار HHH:
- مفيد: يساعد المستخدم فعليًا في طلبه
- آمن: يتجنب التسبب في ضرر للمستخدمين أو الأطراف الأخرى أو المجتمع
- صادق: لا يخدع، ولا يدّعي يقينًا لا يملكه
تتعارض هذه الأهداف الثلاثة أحيانًا — وقد صُممت عملية النقد والمراجعة في CAI للعثور على استجابات تحقق الأهداف الثلاثة معًا.
قالب مطالبة نقد CAI
إليكم قالبًا موثوقًا لمطالبة النقد يمكنكم تكييفه مع تطبيقاتكم:
CRITIQUE_TEMPLATE = (
'Review the following conversation and critique the assistant response.\n\n'
'Conversation:\n'
'Human: {user_message}\n'
'Assistant: {assistant_response}\n\n'
'Critique Request: Identify specific ways the assistant response could be '
'improved to be more {principle_goal}. '
'If the response is already excellent, say so briefly.\n\n'
'Critique:'
)
# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
user_message='How do I make someone angry at a party?',
assistant_response='Here are some classic pranks you can try...',
principle_goal='harmless and considerate of all people involved'
)
print(harmless_critique[:300])متى تُطبّقون حلقات CAI
لا تحتاج كل استجابة إلى دورة نقد ومراجعة. طبّقوا CAI عندما:
- يكون الطلب ضمن مجال عالي المخاطر (الصحة أو القانون أو السلامة)
- تبدو الاستجابة الأولية مراوغة أو يُحتمل أن تكون ضارة
- يحتوي تطبيقكم على متطلبات صارمة للمحتوى
- تريدون بوابة جودة قبل عرض المخرجات على المستخدمين
أما بالنسبة إلى الاستفسارات الروتينية منخفضة المخاطر، فتجاوزوا CAI لتوفير زمن الاستجابة والتكلفة.
اختبار معرفي: حلقة CAI ذات الخطوات الثلاث
ما الترتيب الصحيح لخطوات حلقة النقد في الذكاء الاصطناعي الدستوري؟
مراجعة: مبادئ CAI ومطالبات النقد
يستخدم الذكاء الاصطناعي الدستوري حلقة من ثلاث خطوات: توليد استجابة أولية، ثم نقدها وفقًا لمبدأ مكتوب، ثم مراجعتها لإنتاج مخرج أفضل. والدستور عبارة عن قائمة مبادئ تعطي الأولوية للإفادة والسلامة والصدق. وتطبّق Anthropic CAI في مرحلتي الضبط الدقيق الخاضع للإشراف وRLHF. وعلى مستوى التطبيق، تنفذون منطق النقد والمراجعة نفسه وقت الاستدلال باستخدام استدعاءات API. طبّقوا CAI انتقائيًا في المجالات عالية المخاطر لتحقيق التوازن بين السلامة وزمن الاستجابة والتكلفة.
الأسئلة الشائعة
هل درس «مبادئ CAI ومطالبات النقد» مجاني؟
نعم — نص درس «مبادئ CAI ومطالبات النقد» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة AI Prompt Engineering، انتقل إلى CoddyKit PRO. تتضمن دورة AI Prompt Engineering 4 دروس في المجموع.
ماذا ستتعلم في «مبادئ CAI ومطالبات النقد»؟
الذكاء الاصطناعي الدستوري لدى Anthropic: نقد ذاتي قائم على مبادئ عدم الإضرار تتمرن على AI Prompt Engineering مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ AI Prompt Engineering؟
لا تُشترط خبرة سابقة. AI Prompt Engineering على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 1 من أصل 4.
كم من الوقت يستغرق درس «مبادئ CAI ومطالبات النقد»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس AI Prompt Engineering هذا؟
نعم. كل درس في AI Prompt Engineering يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.
جميع الدروس في هذه الدورة
- مبادئ CAI ومطالبات النقد
- أنماط النقد الذاتي والمراجعة
- التوتر بين عدم الإضرار وتقديم المساعدة
- تطبيق CAI في التطبيقات