المفاضلات: زمن الاستجابة والتكلفة والقدرة
توفر الأوزان المفتوحة المال، لكنها تستهلك ساعات هندسية؛ أجرِ اختبارات أداء قبل الالتزام.
المفاضلات: زمن الاستجابة والتكلفة والقدرة درس مجاني في AI Agents على CoddyKit. هذا هو الدرس 4 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في AI Agents، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة AI Agents 4 دروس في المجموع.
ثلاثة محاور، اختاروا محورين
تتضمن كل عملية اختيار لنموذج مفاضلة بين ما يلي:
- زمن الاستجابة — الوقت اللازم لكل استجابة
- التكلفة — لكل مليون رمز
- القدرة — الجودة في المهام الصعبة
لا يوجد نموذج هو الأفضل في المحاور الثلاثة جميعًا.
مشهد القدرات
| الفئة العليا | الفئة المتوسطة | الفئة الصغيرة | |
|---|---|---|---|
| مغلقة | GPT-4o، Claude Sonnet 4.5 | GPT-4o-mini، Haiku | — |
| مفتوحة | Llama 3.1 405B | Llama 3.1 70B، Qwen 2.5 72B | Llama 3.1 8B، Phi-3 |
مشهد زمن الاستجابة
زمن الاستجابة التقريبي عند النسبة المئوية 50 لدورة وكيل نموذجية:
- Groq Llama 3.1 70B: نحو 200ms، سريع للغاية
- gpt-4o-mini: نحو 600ms
- gpt-4o: نحو 1500ms
- Llama 70B مستضاف ذاتيًا على 1xH100: نحو 800ms
- Llama 8B مستضاف ذاتيًا على RTX 4090: نحو 200ms
التكلفة لكل مليون رمز (تقريبية)
تقديرات تقريبية في منتصف عام 2025، للإدخال/الإخراج:
- GPT-4o: $2.50 / $10
- GPT-4o-mini: $0.15 / $0.60
- Claude Sonnet 4.5: $3 / $15
- Claude Haiku: $0.80 / $4
- Together Llama 70B: $0.88 / $0.88
- Groq Llama 70B: $0.59 / $0.79
- الاستضافة الذاتية (باستخدام وحدة GPU الخاصة بك): مجانية عمليًا لكل رمز
احسب نقطة التعادل الخاصة بك
لا توفر الاستضافة الذاتية المال إلا بعد تجاوز حد معين من حجم الاستخدام. إليك تقديرًا تقريبيًا:
GPU_COST_PER_HOUR = 1.5
GPU_TOKENS_PER_SECOND = 50
TOKENS_PER_HOUR = GPU_TOKENS_PER_SECOND * 3600
# 180,000 tokens/hour
print(f"Tokens per hour: {TOKENS_PER_HOUR:,}")
breakeven_tokens = GPU_COST_PER_HOUR / 0.6e-6
print(f"Breakeven vs $0.60/1M closed-model price: {breakeven_tokens:,.0f} tokens/hour")
print("Far above typical small-app traffic")
توجيه النماذج
استخدم النماذج منخفضة التكلفة افتراضيًا، وانتقل إلى النماذج الأعلى تكلفة عند الحاجة فقط:
def answer(query):
cheap = call_model('gpt-4o-mini', query)
if confidence(cheap) > 0.8:
return cheap
return call_model('gpt-4o', query)التوجيه لكل خطوة
وجّه الطلبات داخل الوكيل في كل خطوة:
- ضع الخطة باستخدام GPT-4o (للاستدلال الصعب)
- نفّذ البحث باستخدام Llama 8B (للحلقات منخفضة التكلفة)
- ركّب النتيجة باستخدام Claude (لجودة الكتابة)
المسارات الحساسة لزمن الاستجابة
بالنسبة إلى الصوت/الدردشة في الوقت الفعلي:
- استخدم Groq أو SambaNova أو Cerebras للوصول إلى زمن استجابة أقل من 200 مللي ثانية
- أرسل الرموز تدريجيًا وبكثافة
- تجنّب الوكلاء متعددي الخطوات في المسار الحرج
المسارات الحساسة للجودة
بالنسبة إلى الإجابات النهائية والأعمال عالية الأهمية:
- استخدم أفضل نموذج يمكنك تحمّل تكلفته
- أضف نقدًا متبادلًا بين النماذج (يكتب GPT-4 وتراجع Claude)
- أضف عملية تحقق (شغّل التعليمات البرمجية وتحقق من الحقائق)
التكلفة الإجمالية للملكية
تشمل تكلفة الاستضافة الذاتية ما يلي:
- استئجار وحدة GPU أو النفقات الرأسمالية
- وقت المهندسين لإدارة البنية التحتية
- المراقبة والاستدعاء عند الحاجة
- معدل نقل أقل من الخدمات المستضافة
بالنسبة إلى معظم الفرق، تكون واجهات API المستضافة أقل تكلفة من حيث التكلفة الإجمالية للملكية إلى أن يصل الاستخدام إلى حجم كبير جدًا.
متى تدفع مقابل النماذج المغلقة الكبيرة
- الإجابات النهائية الموجّهة إلى المستخدمين
- الاستدلال المتقدم
- تعدد الوسائط
- سياق يتجاوز 200 ألف رمز
أجرِ اختبارًا معياريًا على مهمتك
لا تخبرك الاختبارات المعيارية العامة إلا بجزء من القصة. أنشئ مجموعة تقييم من 50 سؤالًا باستخدام بياناتك الفعلية، ثم قِس أداء كل نموذج مرشح عليها. اختر النموذج الأقل تكلفة الذي يحقق الجودة المطلوبة.
استراتيجية التوجيه
ما أرخص استراتيجية لتوجيه النماذج التي تظل قادرة على تحقيق الجودة المطلوبة؟
مراجعة
زمن الاستجابة والتكلفة والقدرات — اختر اثنين منها. استخدم النماذج منخفضة التكلفة افتراضيًا، وانتقل إلى نماذج أقوى عند الحاجة. وغالبًا ما تتفوق واجهات API المستضافة للنماذج المفتوحة (Groq وTogether) على كلا الخيارين المتطرفين.
الأسئلة الشائعة
هل درس «المفاضلات: زمن الاستجابة والتكلفة والقدرة» مجاني؟
نعم — نص درس «المفاضلات: زمن الاستجابة والتكلفة والقدرة» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة AI Agents، انتقل إلى CoddyKit PRO. تتضمن دورة AI Agents 4 دروس في المجموع.
ماذا ستتعلم في «المفاضلات: زمن الاستجابة والتكلفة والقدرة»؟
توفر الأوزان المفتوحة المال، لكنها تستهلك ساعات هندسية؛ أجرِ اختبارات أداء قبل الالتزام. تتمرن على AI Agents مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ AI Agents؟
لا تُشترط خبرة سابقة. AI Agents على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 4 من أصل 4.
كم من الوقت يستغرق درس «المفاضلات: زمن الاستجابة والتكلفة والقدرة»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس AI Agents هذا؟
نعم. كل درس في AI Agents يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.
جميع الدروس في هذه الدورة
- نظرة عامة على Llama وMistral وQwen
- تشغيل النماذج المحلية باستخدام Ollama وllama.cpp
- استدعاء الدوال في النماذج المفتوحة (Hermes وFunctionary)
- المفاضلات: زمن الاستجابة والتكلفة والقدرة