0Pricing
AI Agents · درس

تقييم النماذج المضبوطة مقارنةً بالأساسية

أجرِ اختبار A/B مقابل النموذج الأساسي على مجموعة التقييم لديك — فالضبط الدقيق يضر أحيانًا أكثر مما ينفع.

تقييم النماذج المضبوطة مقارنةً بالأساسية درس مجاني في AI Agents على CoddyKit. هذا هو الدرس 4 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في AI Agents، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة AI Agents 4 دروس في المجموع.

بعض أجزاء هذا الدرس لم تُترجم بعد وتظهر باللغة الإنجليزية.

لا تثقوا بخسارة التدريب

لا تعني خسارة التدريب المنخفضة أداءً أفضل في الإنتاج. فقد يفرط النموذج في التخصيص، أو يفقد قدرته العامة، أو يضر بالمهام التي لم يرها.

أجروا دائمًا تقييمًا للنموذج المضبوط باستخدام مجموعة تقييم محجوزة.

أقسام التقييم الثلاثة الأساسية

  1. التدريب — تُستخدم أثناء الضبط الدقيق
  2. التحقق — تُستخدم لاختيار أفضل نقطة تحقق
  3. الاختبار — لا يراها النموذج أثناء التدريب، وتُستخدم حصريًا للتقييم النهائي

A/B Against Base

results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')

انتبهوا إلى النسيان الكارثي

قد يجعل الضبط الدقيق باستخدام بيانات ضيقة النموذج أسوأ في مهام أخرى. اختبروا النموذج أيضًا على مجموعة تقييم واسعة، لا على تخصصكم الجديد وحده.

إعداد التقارير حسب الفئة

ضعوا علامات على مجموعة التقييم، وأبلغوا عن النتائج لكل فئة:

Category 'extraction': base 0.78 -> tuned 0.91  (+0.13)
Category 'reasoning':  base 0.85 -> tuned 0.78  (-0.07)   <-- regression
Category 'chat':       base 0.82 -> tuned 0.83  (+0.01)

المعايرة

غالبًا ما تصبح النماذج المضبوطة مفرطة في الثقة. قارنوا بين الاحتمال المتوقع لصحة الإجابة والاحتمال الفعلي، وأجروا المعايرة عند الحاجة.

انحراف الطول والأسلوب

تنحرف النماذج المضبوطة نحو توزيع بيانات التدريب. فإذا كانت بيانات التدريب أقصر، تصبح المخرجات أقصر. وقد يكون ذلك مرغوبًا أحيانًا، وغير مرغوب أحيانًا أخرى.

اختبار A/B في العالم الحقيقي

إضافة إلى التقييمات غير المتصلة، أجروا اختبار A/B في الإنتاج:

if user.bucket == 'tuned':
    response = tuned_model.run(...)
else:
    response = base_model.run(...)

log_metric('thumbs_up', response.feedback)

مقارنة الجودة والتكلفة

قد يكون النموذج المضبوط أصغر أو أقل تكلفة. احسبوا التكلفة والجودة الإجماليتين:

  • GPT-4o الأساسي: تكلفة قدرها $X لكل استدعاء، وجودة قدرها Y
  • Llama 8B المضبوط (مستضاف ذاتيًا): تكلفة قدرها $X/10 لكل استدعاء، وجودة قدرها 0.9Y
  • من المرجح أن يكون هو الفائز إذا ظلت Y مرتفعة بما يكفي

أنماط الفشل الخفية

جرّبوا مدخلات عدائية:

  • مطالبات تحاول تجاوز حواجز الحماية
  • مدخلات خارج توزيع البيانات
  • مطالبات للحالات الحدّية

تُضعف عمليات الضبط الدقيق الأمان أحيانًا، لذا تحققوا من ذلك قبل الإطلاق.

تنبيه بشأن استخدام LLM كحَكَم

إذا استخدمتم نموذج LLM للحكم، فاستخدموا عائلة نماذج مختلفة عن عائلة النموذج المضبوط. وإلا فسيمنح الحكم درجات مرتفعة متحيزة.

متى تكررون تحسين مجموعة البيانات

إذا أظهر التقييم تراجعًا في فئات محددة:

  1. ابحثوا عن أمثلة مشابهة في سجلات التنفيذ الإنتاجية
  2. أضيفوها إلى مجموعة التدريب
  3. أعيدوا التدريب
  4. أعيدوا التقييم

لا بأس بالتراجع

إذا كان أداء الضبط أسوأ، فتخلوا عنه وحاولوا مرة أخرى. فالتكلفة الغارقة ليست سببًا لإطلاق نموذج أسوأ.

النسيان الكارثي

ما المقصود بالنسيان الكارثي في الضبط الدقيق؟

مراجعة

قيّموا النموذج المضبوط مقابل النموذج الأساسي باستخدام مجموعة البيانات المرجعية الخاصة بكم. راقبوا حالات التراجع حسب الفئة. أجروا اختبار A/B في الإنتاج. تراجعوا إذا خسر النموذج، وحسّنوا مجموعة البيانات تكراريًا إذا نجح جزئيًا.

الأسئلة الشائعة

هل درس «تقييم النماذج المضبوطة مقارنةً بالأساسية» مجاني؟

نعم — نص درس «تقييم النماذج المضبوطة مقارنةً بالأساسية» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة AI Agents، انتقل إلى CoddyKit PRO. تتضمن دورة AI Agents 4 دروس في المجموع.

ماذا ستتعلم في «تقييم النماذج المضبوطة مقارنةً بالأساسية»؟

أجرِ اختبار A/B مقابل النموذج الأساسي على مجموعة التقييم لديك — فالضبط الدقيق يضر أحيانًا أكثر مما ينفع. تتمرن على AI Agents مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.

هل أحتاج إلى خبرة سابقة لأبدأ AI Agents؟

لا تُشترط خبرة سابقة. AI Agents على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 4 من أصل 4.

كم من الوقت يستغرق درس «تقييم النماذج المضبوطة مقارنةً بالأساسية»؟

معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.

هل يمكنني كتابة وتشغيل أكواد في درس AI Agents هذا؟

نعم. كل درس في AI Agents يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.

جميع الدروس في هذه الدورة

  1. متى يتفوق الضبط الدقيق على صياغة المطالبات
  2. جمع البيانات: المسارات وإعادة تشغيل التتبعات
  3. LoRA وQLoRA للضبط منخفض التكلفة
  4. تقييم النماذج المضبوطة مقارنةً بالأساسية
← العودة إلى AI Agents