0Pricing
AI Agents · درس

التطوير المدفوع بالتقييم للوكلاء

اكتب التقييم قبل إطلاق الوكيل؛ فهذه هي الطريقة الوحيدة للتكرار دون تراجعات.

التطوير المدفوع بالتقييم للوكلاء درس مجاني في AI Agents على CoddyKit. هذا هو الدرس 1 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في AI Agents، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة AI Agents 4 دروس في المجموع.

بعض أجزاء هذا الدرس لم تُترجم بعد وتظهر باللغة الإنجليزية.

التقييمات هي اختبارات للذكاء الاصطناعي

لن تطلق تعليمات برمجية من دون اختبارات. وينطبق المنطق نفسه على وكلاء LLM — فمن دون تقييمات، تصبح كل عملية تغيير أشبه برمية عملة.

يعني التطوير المدفوع بالتقييم (EDD) كتابة التقييم قبل إطلاق التغيير.

حلقة EDD

  1. اكتب تقييمًا فاشلًا: الإدخال والسلوك المتوقع
  2. حسّن الوكيل حتى ينجح التقييم
  3. أضف التقييم إلى مجموعتك
  4. شغّله مع كل تغيير

ما الذي ينبغي تقييمه

بالنسبة إلى الوكيل، أجرِ التقييم على مستويات متعددة:

  • المكوّن — هل يعيد المسترجِع المقاطع الصحيحة؟
  • الخطوة — هل يختار LLM الأداة الصحيحة؟
  • من البداية إلى النهاية — هل ينتج الوكيل الإجابة النهائية الصحيحة؟

بيانات التقييم

يحتوي كل صف في التقييم، كحد أدنى، على ما يلي:

eval_example = {
    'input': 'What is our return policy?',
    'expected_output': 'mentions 30-day window',
    'expected_tool_calls': ['retrieve'],
    'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
    print(f"{k}: {v}")

Run an Eval Suite

def run_evals(suite, agent):
    results = []
    for case in suite:
        actual = agent.run(case['input'])
        scores = [
            score_correctness(actual, case['expected_output']),
            score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
        ]
        results.append({'case': case, 'actual': actual, 'scores': scores})
    return results

التكامل مع CI

شغّل التقييمات مع كل طلب دمج (PR). وإذا انخفضت الجودة عن الحد المطلوب، فامنع الدمج:

# .github/workflows/evals.yml
on: pull_request
jobs:
  evals:
    runs-on: ubuntu-latest
    steps:
      - run: python -m evals.run --fail-below 0.85

وتيرة التقييم

  • تقييمات المكوّنات — مع كل طلب دمج
  • التقييمات من البداية إلى النهاية — مع كل طلب دمج (عينة) وكل ليلة (بالكامل)
  • آثار الإنتاج -> مجموعة التقييم — أسبوعيًا

خط أنابيب الإنتاج -> التقييم

استخرج الآثار الحقيقية. وحوّل النتائج السيئة إلى تقييمات الغد:

for trace in production_traces_with_thumbs_down():
    add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)

تقييم LangSmith / Langfuse

تدعم كلتا الأداتين التقييمات مدمجةً: إصدار مجموعات البيانات، ودوال التقييم، وواجهات مقارنة.

فحوصات يدوية عشوائية

قد تفوّت التقييمات الآلية الأسلوب والفروق الدقيقة. اقرأ يدويًا 20 أثرًا عشوائيًا من حين إلى آخر — فهذا يكشف مشكلات قد تفوّت التقييمات اكتشافها.

نمط مضاد: حفظ مجموعة التقييم عن ظهر قلب

إذا ضبطت الوكيل حتى ينجح في تقييمك، وكانت مجموعة التقييم صغيرة، فقد أفرطت في الملاءمة. واصل توسيع التقييمات، وبدّل تقسيمات التدريب والاختبار بالتناوب.

صيانة مجموعة التقييم

تتغير التقييمات مع تغيّر منتجك. أضف حالات للميزات الجديدة، وأوقف استخدام الحالات الخاصة بالميزات التي أُزيلت.

تعريف EDD

ماذا يعني التطوير المدفوع بالتقييم؟

مراجعة

التطوير المدفوع بالتقييم أمر لا غنى عنه للوكلاء الجادين. اكتب تقييمات على كل مستوى، وشغّلها في CI، ووسّع مجموعتك انطلاقًا من آثار الإنتاج.

الأسئلة الشائعة

هل درس «التطوير المدفوع بالتقييم للوكلاء» مجاني؟

نعم — نص درس «التطوير المدفوع بالتقييم للوكلاء» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة AI Agents، انتقل إلى CoddyKit PRO. تتضمن دورة AI Agents 4 دروس في المجموع.

ماذا ستتعلم في «التطوير المدفوع بالتقييم للوكلاء»؟

اكتب التقييم قبل إطلاق الوكيل؛ فهذه هي الطريقة الوحيدة للتكرار دون تراجعات. تتمرن على AI Agents مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.

هل أحتاج إلى خبرة سابقة لأبدأ AI Agents؟

لا تُشترط خبرة سابقة. AI Agents على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 1 من أصل 4.

كم من الوقت يستغرق درس «التطوير المدفوع بالتقييم للوكلاء»؟

معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.

هل يمكنني كتابة وتشغيل أكواد في درس AI Agents هذا؟

نعم. كل درس في AI Agents يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.

جميع الدروس في هذه الدورة

  1. التطوير المدفوع بالتقييم للوكلاء
  2. بناء مجموعة اختبارات مرجعية
  3. مخاطر استخدام LLM بوصفه حَكمًا
  4. مجموعات اختبار الأداء: SWE-Bench وGAIA وToolBench
← العودة إلى AI Agents