0Pricing
AI Agents · درس

جمع البيانات: المسارات وإعادة تشغيل التتبعات

أعد تشغيل تتبعات الوكيل الناجحة لبناء مجموعة تدريب من أزواج (الحالة، الإجراء).

جمع البيانات: المسارات وإعادة تشغيل التتبعات درس مجاني في AI Agents على CoddyKit. هذا هو الدرس 2 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في AI Agents، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة AI Agents 4 دروس في المجموع.

البيانات هي المنتج

الضبط الدقيق يعتمد بنسبة 10% على النمذجة وبنسبة 90% على البيانات. تأتي أكبر تحسينات الجودة من مجموعات البيانات الأفضل، لا من النماذج الأكبر.

كيف يبدو مسار تنفيذ الوكيل

يلتقط مسار التنفيذ تشغيلًا كاملًا واحدًا للوكيل:

trajectory = {
    'task': 'Refactor the auth module',
    'messages': [
        {'role': 'system', 'content': '...'},
        {'role': 'user', 'content': 'Task...'},
        {'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
        {'role': 'tool', 'content': '...'},
        ...
    ],
    'outcome': 'success'
}

استخراج سجلات التنفيذ من الإنتاج

أفضل مصدر للبيانات هو الاستخدام الفعلي:

for trace in production_traces:
    if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
        save_to_training_set(trace)

إعادة تشغيل سجل التنفيذ

أعيدوا تشغيل سجل تنفيذ ناجح للتحقق من قابلية إعادة إنتاجه، ولاستخدامه مثالًا تدريبيًا:

def replay(trace):
    messages = trace.messages[:1]   # just the initial user msg
    for expected_msg in trace.messages[1:]:
        actual = agent.step(messages)
        if actual.role == 'assistant':
            messages.append(actual)
        elif expected_msg.role == 'tool':
            messages.append(expected_msg)   # replay tool result

تصفية سجلات التنفيذ عالية الجودة

  • النتيجة ناجحة (تنجح الاختبارات ويكون المستخدم راضيًا)
  • سجل التنفيذ قصير (من دون محاولات متكررة غير مجدية)
  • استدعاءات الأدوات منطقية
  • لم يتم تشغيل أي تنبيهات أمنية

التقطير من النماذج الكبيرة

استخدموا نموذجًا قويًا (GPT-4o) لإنشاء مسارات تنفيذ لهدف الضبط (Llama 8B):

for task in task_list:
    traj = big_model_agent.run(task)
    if traj.success:
        save_for_training(traj)

# Now fine-tune Llama 8B on the GPT-4o traces.

استبعاد مسارات التنفيذ السيئة

يكفي مثال سيئ واحد لإفساد التدريب. لذلك أجروا تصفية صارمة:

  • احذفوا السجلات التي تتضمن أخطاء
  • احذفوا السجلات التي تتضمن هلوسات في استدعاءات الأدوات
  • احذفوا السجلات التي تتجاوز N من استدعاءات الأدوات
  • احذفوا السجلات التي تتعارض مع السياسة

تنسيق الضبط الدقيق

يتوقع OpenAI تنسيق JSONL مع messages:

{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}

استدعاءات الأدوات في بيانات التدريب

أدرجوا tool_calls ورسائل الأدوات، ليتعلم النموذج حلقة الوكيل كاملة:

{
  "messages": [
    {"role": "user", "content": "Weather in Paris?"},
    {"role": "assistant", "tool_calls": [{...}]},
    {"role": "tool", "tool_call_id": "...", "content": "{...}"},
    {"role": "assistant", "content": "It is 18C and sunny."}
  ]
}

الأمثلة السلبية

تستفيد بعض أساليب التدريب (DPO وKTO) من الأمثلة السيئة أيضًا:

preferences = [
    {'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]

حاسبة حجم مجموعة البيانات

الحجم التقريبي المطلوب حسب أسلوب التدريب:

  • SFT للتنسيق: 500-2000
  • SFT لإضافة قدرة جديدة: 5k-50k
  • DPO: من 1k إلى 10k من أزواج التفضيلات
  • RLHF / RLAIF: 10k-100k+

إدارة إصدارات مجموعة البيانات

تعاملوا مع مجموعة البيانات كما تتعاملون مع الشيفرة. أنشئوا إصدارات لها، وتتبعوا سجلات التنفيذ المضمّنة، واحرصوا على قابلية إعادة إنتاج عمليات البناء.

تنظيم البيانات بمشاركة بشرية

تمر أفضل مجموعات البيانات عبر قائمة انتظار للمراجعة البشرية. وتجعل أدوات مثل Argilla وLabel Studio وSnorkel هذه العملية فعالة.

أفضل مصدر لسجلات التنفيذ

ما المصدر الأعلى قيمة من حيث الإشارة لمسارات التنفيذ التدريبية؟

مراجعة

تُعد مسارات التنفيذ الناتجة عن عمليات تشغيل ناجحة فعلية كنزًا. أجروا التقطير من النماذج القوية عند الحاجة. صفّوا البيانات بصرامة. وأديروا إصدارات مجموعة البيانات.

الأسئلة الشائعة

هل درس «جمع البيانات: المسارات وإعادة تشغيل التتبعات» مجاني؟

نعم — نص درس «جمع البيانات: المسارات وإعادة تشغيل التتبعات» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة AI Agents، انتقل إلى CoddyKit PRO. تتضمن دورة AI Agents 4 دروس في المجموع.

ماذا ستتعلم في «جمع البيانات: المسارات وإعادة تشغيل التتبعات»؟

أعد تشغيل تتبعات الوكيل الناجحة لبناء مجموعة تدريب من أزواج (الحالة، الإجراء). تتمرن على AI Agents مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.

هل أحتاج إلى خبرة سابقة لأبدأ AI Agents؟

لا تُشترط خبرة سابقة. AI Agents على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 2 من أصل 4.

كم من الوقت يستغرق درس «جمع البيانات: المسارات وإعادة تشغيل التتبعات»؟

معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.

هل يمكنني كتابة وتشغيل أكواد في درس AI Agents هذا؟

نعم. كل درس في AI Agents يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.

جميع الدروس في هذه الدورة

  1. متى يتفوق الضبط الدقيق على صياغة المطالبات
  2. جمع البيانات: المسارات وإعادة تشغيل التتبعات
  3. LoRA وQLoRA للضبط منخفض التكلفة
  4. تقييم النماذج المضبوطة مقارنةً بالأساسية
← العودة إلى AI Agents