0Pricing
AI Agents · درس

الوكلاء متعددو الوسائط (الرؤية والصوت والإجراء)

وكلاء يرون الشاشات، ويسمعون الكلام، ويتصرفون في العالم المادي أو الرقمي — هذا هو المجال الرائد التالي.

الوكلاء متعددو الوسائط (الرؤية والصوت والإجراء) درس مجاني في AI Agents على CoddyKit. هذا هو الدرس 3 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في AI Agents، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة AI Agents 4 دروس في المجموع.

ما بعد النص

تتعدد وسائط الوكلاء الحديثين بصورة متزايدة:

  • الرؤية — رؤية الشاشات والصور ومقاطع الفيديو
  • الصوت — التحدث إلى المستخدمين والاستماع إليهم
  • التنفيذ — التحكم في المتصفحات والروبوتات وواجهات المستخدم الرسومية

وكلاء الرؤية

تناولنا هذا في الدورة 24. إليكم مراجعة سريعة:

  • GPT-4o وClaude Sonnet 4.5 وGemini لفهم الشاشات
  • تعليقات SoM التوضيحية للتفاعل الموثوق
  • Computer Use للتحكم الشامل في سطح المكتب

وكلاء الصوت

تتيح لكم OpenAI Realtime API وAnthropic / Claude voice وElevenLabs Conversational AI بناء وكلاء يستقبلون الصوت ويصدرونه:

# OpenAI Realtime API (WebSocket)
import websockets, json

async def main():
    async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
        await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
        async for msg in ws:
            event = json.loads(msg)
            if event['type'] == 'response.audio.delta':
                play_audio(event['delta'])

أهداف زمن الاستجابة الصوتية

يحتاج الصوت الحواري إلى استجابة تقل عن 500 مللي ثانية، وإلا بدا غير طبيعي. ومن الاستراتيجيات المستخدمة:

  • البث المتزامن للتعرّف التلقائي على الكلام وتحويل النص إلى كلام
  • تجاوز نماذج التفكير
  • تخزين العبارات الشائعة مؤقتًا
  • استخدام نماذج خفيفة

الصوت + استخدام الأدوات

يمكن لوكلاء الصوت استخدام الأدوات أيضًا — إذ تدعم Realtime APIs استدعاء الدوال. تخيلوا قولكم: «أضيفوا الحليب إلى قائمة مشترياتي» ← فيستدعي الوكيل add_to_list.

التنفيذ: استخدام المتصفح أو الحاسوب

تناولنا هذا مسبقًا في الدورة 24. تتيح Computer Use من Anthropic وOperator من OpenAI وOpenInterpreter للوكلاء جميعًا التحكم في جهاز حقيقي.

التنفيذ: الروبوتات

الوكلاء المجسّدون هم آفاق المرحلة التالية. تدمج Google RT-2 وFigure 02 وNVIDIA GR00T نماذج VLM مع التحكم في الروبوتات. ولا يزال معظم ذلك في مرحلة البحث، مع عدد قليل من عمليات النشر الإنتاجية حتى الآن.

فهم الفيديو

يقبل Gemini وGPT-4o مقاطع الفيديو. ومن حالات الاستخدام:

  • تلخيصات المراقبة
  • استخراج الوصفات من مقاطع الطهي
  • التحليلات الرياضية
  • تلخيص الاجتماعات من التسجيلات

إنشاء الصور بوصفه أداة

تصبح نماذج الانتشار (DALL-E 3 وImagen وStable Diffusion) أدوات يمكن للوكيل استدعاؤها:

tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]

الاستدلال عبر الوسائط

الوكلاء الذين يجمعون بين الوسائط: «انظروا إلى هذا المخطط، وانسخوا هذه الملاحظات، واكتبوا مسودة ملخص رسالة بريد إلكتروني». تؤدي كل وسيطة دورًا.

حزمة OpenAI Realtime Toolkit

توفر OpenAI حزمة Realtime Agent SDK مفتوحة المصدر مع أمثلة. وهي نقطة بداية جيدة إذا كان الهدف هو بناء وكلاء صوتيين.

وكلاء Pipecat وLiveKit

أطر عمل مفتوحة المصدر لبناء وكلاء صوت وفيديو عبر WebRTC. وتستخدمها العديد من الشركات الناشئة التي تبني مساعدين شبيهين بـ Alexa.

الخصوصية في الأنظمة متعددة الوسائط

يحتوي الصوت والفيديو على قدر كبير من بيانات PII. شفروا البيانات أثناء التخزين، واحجبوا النصوص المفرغة، ووفروا للمستخدمين أزرارًا لحذف بياناتهم. وقد تتطلب القياسات الحيوية الصوتية موافقة بموجب المادة 9 من GDPR.

نماذج حسب مستوى زمن الاستجابة

بالنسبة إلى وكلاء الصوت والفيديو، فضلوا النماذج الأسرع (Groq Llama 3.1 وGPT-4o-realtime وGemini Flash)، وتجنبوا نماذج الاستدلال في المسار الحرج.

عصر النظارات الذكية

تجلب Meta Ray-Ban وApple Vision Pro وغيرها من الأجهزة القابلة للارتداء وكلاءً متعددَي الوسائط يعملون دائمًا. وهذه هي الفئة الاستهلاكية التالية للذكاء الاصطناعي المحيطي.

زمن الاستجابة الصوتية

ما هدف زمن الاستجابة المعتاد لوكلاء الصوت التحاوريين؟

مراجعة

الرؤية (الشاشات والصور والفيديو)، والصوت (المحادثة)، والتنفيذ (المتصفحات وأجهزة الكمبيوتر والروبوتات). ادمجوا الوسائط المتعددة لبناء وكلاء أكثر ثراءً. وانتبهوا إلى زمن الاستجابة والخصوصية والتكلفة.

الأسئلة الشائعة

هل درس «الوكلاء متعددو الوسائط (الرؤية والصوت والإجراء)» مجاني؟

نعم — نص درس «الوكلاء متعددو الوسائط (الرؤية والصوت والإجراء)» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة AI Agents، انتقل إلى CoddyKit PRO. تتضمن دورة AI Agents 4 دروس في المجموع.

ماذا ستتعلم في «الوكلاء متعددو الوسائط (الرؤية والصوت والإجراء)»؟

وكلاء يرون الشاشات، ويسمعون الكلام، ويتصرفون في العالم المادي أو الرقمي — هذا هو المجال الرائد التالي. تتمرن على AI Agents مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.

هل أحتاج إلى خبرة سابقة لأبدأ AI Agents؟

لا تُشترط خبرة سابقة. AI Agents على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 3 من أصل 4.

كم من الوقت يستغرق درس «الوكلاء متعددو الوسائط (الرؤية والصوت والإجراء)»؟

معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.

هل يمكنني كتابة وتشغيل أكواد في درس AI Agents هذا؟

نعم. كل درس في AI Agents يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.

جميع الدروس في هذه الدورة

  1. الاستدلال الوكيلي (o1 وo3 ونماذج الاستدلال)
  2. الوكلاء الهجينون الرمزيون والعصبيون
  3. الوكلاء متعددو الوسائط (الرؤية والصوت والإجراء)
  4. مسائل مفتوحة: المتانة والمواءمة والذاكرة طويلة الأمد
← العودة إلى AI Agents