0Pricing
Learn AI with Python · درس

المفاهيم الأساسية في التعلم المعزز

الوكيل والبيئة والمكافآت والعقوبات

المفاهيم الأساسية في التعلم المعزز درس مجاني في Learn AI with Python على CoddyKit. هذا هو الدرس 1 من أصل 5. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في Learn AI with Python، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة Learn AI with Python 5 دروس في المجموع.

ما هو التعلم المعزز؟

المفاهيم الأساسية في التعلم المعزز

التعلم المعزز (RL) هو نوع من التعلم الآلي يتعلم فيه الوكيل اتخاذ القرارات من خلال التفاعل مع البيئة. والهدف هو تعظيم المكافآت بمرور الوقت.

تشمل المكونات الأساسية للتعلم المعزز الوكلاء، والبيئات، والمكافآت، والعقوبات.

المفاهيم الأساسية في التعلم المعزز — رسم توضيحي 1

المصطلحات الأساسية في RL

المصطلحات الأساسية في RL

مصطلحات مهمة في التعلم المعزز:

  • الوكيل: متخذ القرار (مثل روبوت أو برنامج).
  • البيئة: النظام الذي يتفاعل معه الوكيل.
  • الحالة: الوضع الحالي للبيئة.
  • الإجراء: القرار الذي يتخذه الوكيل.
  • المكافأة: الملاحظات التي تقدمها البيئة مقابل إجراء ما.

تفاعل الوكيل مع البيئة

تفاعل الوكيل مع البيئة

يمكن تلخيص التفاعل بين الوكيل والبيئة كما يلي:

  1. يراقب الوكيل الحالة الحالية للبيئة.
  2. يتخذ الوكيل إجراءً استنادًا إلى سياسة.
  3. تنتقل البيئة إلى حالة جديدة وتقدم مكافأة.

تستمر هذه الحلقة حتى الوصول إلى حالة نهائية.

المكافآت والعقوبات

المكافآت والعقوبات

المكافآت هي الملاحظات التي يحصل عليها الوكيل مقابل إجراءاته. والهدف هو تعظيم المكافأة التراكمية بمرور الوقت. أما العقوبات فهي مكافآت سلبية تثبط الإجراءات غير المرغوب فيها.

على سبيل المثال:

  • المكافأة: +10 عند الوصول إلى هدف.
  • العقوبة: -5 عند الاصطدام بعائق.

السياسات في RL

السياسات في RL

السياسة هي استراتيجية يستخدمها الوكيل لتحديد الإجراءات استنادًا إلى الحالة الحالية.

أنواع السياسات:

  • حتمية: تختار الإجراء نفسه دائمًا لحالة معينة.
  • احتمالية: تختار الإجراءات باحتمالات مختلفة.

الاستكشاف مقابل الاستغلال

الاستكشاف مقابل الاستغلال

يواجه الوكيل مفاضلة بين:

  • الاستكشاف: تجربة إجراءات جديدة لاكتشاف المزيد عن البيئة.
  • الاستغلال: اختيار الإجراءات التي تحقق أعلى مكافأة معروفة.

يُعد تحقيق التوازن بينهما أمرًا بالغ الأهمية للتعلم الفعال.

عملية اتخاذ القرار الماركوفية (MDP)

عملية اتخاذ القرار الماركوفية (MDP)

غالبًا ما تُنمذج مسائل التعلم المعزز باعتبارها عملية اتخاذ قرار ماركوفية (MDP)، وتُعرّف بما يلي:

  • الحالات (S): التكوينات الممكنة للبيئة.
  • الإجراءات (A): الخيارات المتاحة للوكيل.
  • المكافآت (R): الملاحظات الناتجة عن الإجراءات.
  • احتمالات الانتقال (P): احتمال الانتقال بين الحالات.

تحديات التعلم المعزز

تحديات التعلم المعزز

ينطوي التعلم المعزز على بعض التحديات:

  • المكافآت المؤجلة: قد تُستلم المكافآت بعد تنفيذ عدة إجراءات.
  • المكافآت المتناثرة: قد تحدث المكافآت على فترات متباعدة.
  • الأبعاد العالية: بيئات معقدة تحتوي على حالات وإجراءات كثيرة.

الملخص والخطوات التالية

الملخص والخطوات التالية

في هذا الدرس:

  • استكشفنا المفاهيم الأساسية للتعلم المعزز، بما في ذلك الوكلاء والبيئات والمكافآت.
  • ناقشنا السياسات، والاستكشاف مقابل الاستغلال، وعمليات اتخاذ القرار الماركوفية (MDPs).
  • تعرفنا على التحديات في التعلم المعزز.

بعد ذلك، سنتعمق في مفهوم جدول Q، وهو أحد الأساليب الأساسية في التعلم المعزز.

المفاهيم الأساسية في التعلم المعزز — رسم توضيحي 10

الأسئلة الشائعة

هل درس «المفاهيم الأساسية في التعلم المعزز» مجاني؟

نعم — نص درس «المفاهيم الأساسية في التعلم المعزز» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة Learn AI with Python، انتقل إلى CoddyKit PRO. تتضمن دورة Learn AI with Python 5 دروس في المجموع.

ماذا ستتعلم في «المفاهيم الأساسية في التعلم المعزز»؟

الوكيل والبيئة والمكافآت والعقوبات تتمرن على Learn AI with Python مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.

هل أحتاج إلى خبرة سابقة لأبدأ Learn AI with Python؟

لا تُشترط خبرة سابقة. Learn AI with Python على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 1 من أصل 5.

كم من الوقت يستغرق درس «المفاهيم الأساسية في التعلم المعزز»؟

معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.

هل يمكنني كتابة وتشغيل أكواد في درس Learn AI with Python هذا؟

نعم. كل درس في Learn AI with Python يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.

جميع الدروس في هذه الدورة

  1. المفاهيم الأساسية في التعلم المعزز
  2. مفهوم Q-Table
  3. تطبيق Q-Table في Python
  4. التعلم المعزز العميق باستخدام Q
  5. استكشاف OpenAI Gym
← العودة إلى Learn AI with Python