مجموعات اختبار الأداء: SWE-Bench وGAIA وToolBench
اختبارات أداء عامة لوكلاء البرمجة (SWE-Bench) والمساعدين العامين (GAIA) واستخدام الأدوات (ToolBench).
مجموعات اختبار الأداء: SWE-Bench وGAIA وToolBench درس مجاني في AI Agents على CoddyKit. هذا هو الدرس 4 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في AI Agents، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة AI Agents 4 دروس في المجموع.
بعض أجزاء هذا الدرس لم تُترجم بعد وتظهر باللغة الإنجليزية.
الاختبارات المعيارية العامة
تُعد الاختبارات المعيارية العامة ضرورية لمقارنة النماذج والأطر بين الفرق. وهي تغطي قدرات الوكلاء الشائعة:
- SWE-Bench — مهام هندسة البرمجيات
- GAIA — مهام المساعد العام
- ToolBench / BFCL — استخدام الأدوات
- WebArena — التنقل في المتصفح
SWE-Bench
يختبر SWE-Bench قدرة الوكيل على حل مشكلات GitHub الفعلية:
- 2294 مشكلة فعلية من مستودعات Python الشائعة
- يجب على الوكيل إنتاج تصحيح ينجح في جميع الاختبارات المخفية
- تحل أفضل الوكلاء المتقدمين حاليًا 50–70% منها (مقابل أقل من 5% في عام 2023)
SWE-Bench Verified
أصدرت OpenAI مجموعة فرعية مكوّنة من 500 مشكلة، مع فحوصات جودة أكثر صرامة (SWE-Bench Verified). ويُعد هذا المعيار المتبع في المجال.
GAIA
اختبار معياري للمساعد العام للذكاء الاصطناعي (Meta + HF، 2023):
- 466 سؤالًا عبر ثلاثة مستويات من الصعوبة
- يتطلب التصفح وتنفيذ التعليمات البرمجية والاستدلال متعدد الوسائط
- صُمم بحيث يستغرق حله من الإنسان نحو 30 ثانية؛ وتصل أفضل الوكلاء إلى نحو 60%
مثال على سؤال في GAIA
«كم عدد ألبومات الاستوديو الخاصة بـ Mercedes Sosa التي نُشرت بين عامي 1972 و1985؟ استخدم القائمة الموجودة في صفحة Wikipedia الإنجليزية الخاصة بها.»
يتطلب ذلك التصفح وقراءة جدول وإجراء عملية عد — وهي مهام نموذجية للوكلاء متعددي الخطوات.
لوحة Berkeley لتقييم استدعاء الدوال (BFCL)
المعيار المتبع لتقييم استدعاء الأدوات:
- آلاف الثلاثيات من (الاستعلام، تعريف الأداة، الاستدعاء المتوقع)
- تغطي سيناريوهات الاستدعاء البسيط والمتوازي وعدم استدعاء الأداة
- تُحدّث كل ثلاثة أشهر
ToolBench
أكبر لكنه أقل تنظيمًا: أكثر من 16 ألف واجهة API من RapidAPI، مع سلاسل أدوات متعددة الخطوات. وهو أقل معيارية من BFCL، لكنه يغطي نطاقًا أوسع.
WebArena
اختبار معياري مفتوح المصدر لوكلاء تصفح الويب. يستضيف 4 مواقع ويب مستقلة (التجارة الإلكترونية والمنتدى وبوابة المطورين وGitLab)، ويجب على الوكلاء إكمال مهام واقعية.
Running SWE-Bench Locally
git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .
# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
--predictions_path my_agent_preds.json \
--max_workers 4قيود الاختبارات المعيارية
- تتسرب الاختبارات المعيارية العامة إلى بيانات التدريب (مخاطر التحايل)
- مجال واحد — قد تكون مهمتك أصعب أو أسهل
- تخفي عبارة «حل X%» ماهية هذه النسبة — فالجزء طويل الذيل مهم
اختبارك المعياري الخاص أهم
تفيد الاختبارات المعيارية العامة في مقارنة الأساليب. لكن مجموعتك الذهبية الخاصة، المبنية على بياناتك أنت، هي الرقم الوحيد المهم لمنتجك.
الجمع بين التقييمات الداخلية والعامة
ممارسة صحية للفرق:
- شغّل الاختبارات المعيارية العامة كل ثلاثة أشهر لتتبع قدرات النماذج المتقدمة
- شغّل التقييمات الداخلية مع كل طلب دمج
- اعتمد على الأرقام الداخلية في اتخاذ القرارات، وعلى الأرقام العامة لمتابعة المجال
قراءة نتائج الاختبارات المعيارية
عندما تقول ورقة بحثية «75% في SWE-Bench»:
- تحقق من نسخة SWE-Bench المقصودة (Lite أو Verified أو الكاملة)
- تحقق مما إذا كان مسموحًا بإجراء محاولات متعددة
- تحقق مما إذا كانوا قد استخدموا أدوات أو تلميحات مخفية
من السهل إساءة قراءة الأرقام البارزة.
التقييمات الداخلية مقابل العامة
أيهما أهم لمنتجك؟
مراجعة
SWE-Bench لوكلاء البرمجة، وGAIA للمساعدين العامين، وBFCL لاستخدام الأدوات، وWebArena للمتصفحات. استخدمها لمتابعة المجال، واعتمد على تقييمك الخاص في اتخاذ القرارات.
الأسئلة الشائعة
هل درس «مجموعات اختبار الأداء: SWE-Bench وGAIA وToolBench» مجاني؟
نعم — نص درس «مجموعات اختبار الأداء: SWE-Bench وGAIA وToolBench» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة AI Agents، انتقل إلى CoddyKit PRO. تتضمن دورة AI Agents 4 دروس في المجموع.
ماذا ستتعلم في «مجموعات اختبار الأداء: SWE-Bench وGAIA وToolBench»؟
اختبارات أداء عامة لوكلاء البرمجة (SWE-Bench) والمساعدين العامين (GAIA) واستخدام الأدوات (ToolBench). تتمرن على AI Agents مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ AI Agents؟
لا تُشترط خبرة سابقة. AI Agents على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 4 من أصل 4.
كم من الوقت يستغرق درس «مجموعات اختبار الأداء: SWE-Bench وGAIA وToolBench»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس AI Agents هذا؟
نعم. كل درس في AI Agents يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.
جميع الدروس في هذه الدورة
- التطوير المدفوع بالتقييم للوكلاء
- بناء مجموعة اختبارات مرجعية
- مخاطر استخدام LLM بوصفه حَكمًا
- مجموعات اختبار الأداء: SWE-Bench وGAIA وToolBench