قراءة مخرجات الذكاء الاصطناعي وتقييمها
معايير الحكم على صلة استجابات الذكاء الاصطناعي ودقتها واكتمالها
قراءة مخرجات الذكاء الاصطناعي وتقييمها درس مجاني في AI Prompt Engineering على CoddyKit. هذا هو الدرس 1 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في AI Prompt Engineering، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة AI Prompt Engineering 4 دروس في المجموع.
لماذا يهم التقييم
إن الحصول على استجابة من الذكاء الاصطناعي ليس سوى نصف المهمة. أما النصف الثاني فهو الحكم على مدى جودة الاستجابة فعلًا.
من دون إطار واضح للتقييم، قد تقبلون استجابة تبدو مصقولة لكنها تجيب عن السؤال الخطأ، أو ترفضون استجابة مفيدة فعلًا لأنها ليست منسّقة بالطريقة التي توقعتموها.
يُعد تطوير قدرة موثوقة على تمييز جودة مخرجات الذكاء الاصطناعي إحدى أكثر المهارات العملية فائدةً في هندسة المطالبات.
معايير التقييم الأربعة
عند قراءة استجابة من الذكاء الاصطناعي، قيّموها وفق أربعة أبعاد:
- الملاءمة — هل أجابت عن السؤال الفعلي الذي طرحتموه؟
- الدقة — هل المعلومات صحيحة من الناحية الواقعية؟
- الاكتمال — هل غطّت جميع أجزاء الطلب؟
- التنسيق — هل بُنيت بالطريقة التي تحتاجون إليها؟
قد تحقق الاستجابة درجة عالية في ثلاثة أبعاد وتفشل في الرابع. ولكل معيار أهميته المستقلة.
المعيار 1: الملاءمة
الملاءمة تعني: هل أجاب النموذج عن السؤال الذي طرحتموه فعلًا، أم أجاب عن سؤال مختلف لكنه مرتبط به؟
مثال: تسألون "ما مخاطر استخدام نماذج اللغة الكبيرة (LLMs) في الرعاية الصحية؟"، فيجيب النموذج بنظرة عامة عن كيفية عمل نماذج اللغة الكبيرة. قد تكون الإجابة صحيحة، لكنها ليست ملائمة — فقد أخطأت في صلب الموضوع.
للتحقق من الملاءمة، أعيدوا قراءة مطالبتكم الأصلية واسألوا: هل تتناول الإجابة مباشرة ما سألته؟
المعيار 2: الدقة
الدقة تعني: هل الحقائق والأرقام والادعاءات الواردة في الإجابة صحيحة؟
قد تهلوس نماذج الذكاء الاصطناعي — فقد تذكر أمورًا بثقة، رغم أنها خاطئة تمامًا. ومن مشكلات الدقة الشائعة:
- إحصاءات أو تواريخ غير صحيحة
- نِسَب أقوال إلى أصحابها خطأً
- تقديم معلومات قديمة على أنها حديثة
- مراجع أو استشهادات مختلقة
في الموضوعات الواقعية، تحقّقوا دائمًا من الادعاءات الأساسية باستخدام مصدر موثوق قبل استخدام المخرجات.
المعيار 3: الاكتمال
الاكتمال يعني: هل غطّت الإجابة جميع أجزاء طلبكم؟
إذا كانت مطالبتكم تتضمن عدة أجزاء — "اشرحوا X، واذكروا ثلاثة أمثلة، واقترحوا خطوة تالية" — فتحققوا من أن النموذج تناول الأجزاء الثلاثة كلها، لا الجزء الأول فقط.
أحيانًا تُسقط النماذج الجزء الأخير من الطلبات متعددة الأجزاء، خصوصًا إذا كانت المطالبة طويلة. وتُعدّ مقارنة الإجابة بمطالبتكم نقطةً بنقطة الطريقة الأكثر موثوقية للتحقق من الاكتمال.
المعيار 4: التنسيق
التنسيق يعني: هل بُنيت الإجابة بالطريقة التي تحتاجون إليها؟
حتى الإجابة الدقيقة والمكتملة تمامًا قد يصعب استخدامها إذا كان تنسيقها غير مناسب. ومن حالات عدم توافق التنسيق الشائعة:
- نص نثري بينما كنتم تحتاجون إلى نقاط تعداد
- مقالة طويلة بينما كنتم تحتاجون إلى ملخص
- غياب العناوين التي تساعد على التنقل
- كود بلا شرح، أو شرح بلا كود
غالبًا ما تكون مشكلات التنسيق أسهل المشكلات إصلاحًا باستخدام مطالبة متابعة.
قائمة تحقق بسيطة للتقييم
بعد تلقّي أي إجابة من الذكاء الاصطناعي، راجعوا قائمة التحقق الذهنية التالية:
- الملاءمة: هل تجيب عن سؤالي الفعلي؟
- الدقة: هل يمكنني الوثوق بالحقائق؟ وما الذي أحتاج إلى التحقق منه؟
- الاكتمال: هل غطّت جميع أجزاء طلبي؟
- التنسيق: هل بُنيت بطريقة يمكنني استخدامها؟
إذا أخفق أي معيار، فهذا يحدد لكم بالضبط نوع مطالبة المتابعة التي ينبغي كتابتها. إذ يشير كل معيار إلى نوع محدد من التصحيح.
التقييم في الكود: تسجيل درجة للإجابة
يمكنكم بناء غلاف تقييم خفيف باستخدام Python، بحيث يقيّم الإجابة وفق كل معيار من خلال استدعاء ثانٍ لنموذج لغة كبير:
import openai
client = openai.OpenAI(api_key='sk-...')
def evaluate_response(original_prompt, response_text):
eval_prompt = f'''You are an evaluator. Score the following AI response on a scale of 1-5 for each criterion.
Original prompt: {original_prompt}
AI response: {response_text}
Score each:
- Relevance (1-5): Did it answer the actual question?
- Accuracy (1-5): Are the facts correct? (flag any concerns)
- Completeness (1-5): Did it cover all parts of the request?
- Format (1-5): Is it structured appropriately?
Return your scores as: Relevance: X, Accuracy: X, Completeness: X, Format: X
Then a one-sentence note for any score below 4.'''
result = client.chat.completions.create(
model='gpt-4o-mini',
messages=[{'role': 'user', 'content': eval_prompt}]
)
return result.choices[0].message.contentإخفاقات الملاءمة: أنماط شائعة
تميل إخفاقات الملاءمة إلى اتباع أنماط يمكن التنبؤ بها. ويساعدكم التعرّف إليها على تسريع عملية التقييم:
- انحراف الموضوع — يبدأ النموذج بداية صحيحة، ثم ينتقل إلى موضوع ذي صلة
- استبدال السؤال — يجيب النموذج عن نسخة أبسط أو أسهل من سؤالكم
- التعميم المفرط — تسألون عن حالة محددة، فيجيب النموذج عن الحالة العامة
- تجاهل القيد — تحددون سياقًا (مثل: "للمبتدئين")، فيتجاهله النموذج
يشير كل نمط إلى إصلاح محدد يمكن إدراجه في مطالبة المتابعة.
إشارات تحذيرية على ضعف الدقة
حتى عندما يتعذر عليكم التحقق من ادعاء فورًا، تشير بعض العلامات إلى انخفاض مستوى الدقة:
- أرقام دقيقة جدًا مذكورة بلا مصدر
- ادعاءات تبدو ملائمة أكثر من اللازم أو منطبقة تمامًا على المطلوب
- الإشارة إلى دراسات أو أوراق بحثية أو كتب مع ذكر العنوان والمؤلف
- التواريخ وأرقام الإصدارات (فهذه تتغير كثيرًا)
- تفاصيل قانونية أو طبية أو مالية
لا تُثبت هذه العلامات وجود خطأ، لكنها تشير إلى الأمور التي تستحق إعادة التحقق منها قبل استخدام المخرجات في سياق عالي المخاطر.
استخدام التقييم لكتابة مطالبات متابعة أفضل
تكمن القيمة الحقيقية للتقييم في أن كل معيار مُخفق يطابق مباشرة نوعًا معينًا من مطالبات المتابعة:
- إخفاق الملاءمة → "أجبتم عن X، لكنني كنت أسأل عن Y. يُرجى التركيز على Y."
- مخاوف بشأن الدقة → "يُرجى إعادة التحقق من الادعاء المتعلق بـ Z وذكر الأساس الذي استندتم إليه."
- إخفاق الاكتمال → "لم تتناولوا الجزء الثالث من سؤالي. يُرجى إضافته."
- إخفاق التنسيق → "أعيدوا كتابة هذا في صورة نقاط تعداد، مع ملخص من سطر واحد في الأعلى."
يعمل التقييم وكتابة مطالبات المتابعة كحلقة تغذية راجعة.
اختبار المعرفة: معايير التقييم
تسألون النموذج: "اذكروا أفضل 5 أطر عمل للويب في Python، مع وصف من جملة واحدة لكل منها." فيجيب النموذج بمقالة مكتوبة جيدًا عن تاريخ Python وصعودها في تطوير الويب، ويذكر Flask وDjango بإيجاز، لكنه لا يذكر 5 أطر عمل.
ما المعيار الذي تخفق فيه هذه الإجابة بأكبر قدر من الأهمية؟
مراجعة: قراءة مخرجات الذكاء الاصطناعي وتقييمها
تتكون كتابة المطالبات الجيدة من خطوتين: صياغة المطالبة وتقييم الإجابة.
تمنحكم المعايير الأربعة — الملاءمة، والدقة، والاكتمال، والتنسيق — طريقة منهجية لتقييم أي مخرجات للذكاء الاصطناعي. ويحدد كل معيار مُخفق بدقة نوع مطالبة المتابعة التي ينبغي كتابتها.
في الدرس التالي، ستتدربون على كتابة مطالبات المتابعة هذه لتصحيح أنواع محددة من الإخفاقات.
الأسئلة الشائعة
هل درس «قراءة مخرجات الذكاء الاصطناعي وتقييمها» مجاني؟
نعم — نص درس «قراءة مخرجات الذكاء الاصطناعي وتقييمها» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة AI Prompt Engineering، انتقل إلى CoddyKit PRO. تتضمن دورة AI Prompt Engineering 4 دروس في المجموع.
ماذا ستتعلم في «قراءة مخرجات الذكاء الاصطناعي وتقييمها»؟
معايير الحكم على صلة استجابات الذكاء الاصطناعي ودقتها واكتمالها تتمرن على AI Prompt Engineering مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ AI Prompt Engineering؟
لا تُشترط خبرة سابقة. AI Prompt Engineering على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 1 من أصل 4.
كم من الوقت يستغرق درس «قراءة مخرجات الذكاء الاصطناعي وتقييمها»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس AI Prompt Engineering هذا؟
نعم. كل درس في AI Prompt Engineering يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.
جميع الدروس في هذه الدورة
- قراءة مخرجات الذكاء الاصطناعي وتقييمها
- كتابة مطالبات متابعة فعالة
- البناء على الاستجابات السابقة
- متى تُنقّح ومتى تبدأ من جديد