المفاهيم الأساسية للتعلم المعزز
الوكيل والبيئة والمكافآت والعقوبات
المفاهيم الأساسية للتعلم المعزز درس مجاني في Python Academy على CoddyKit. هذا هو الدرس 1 من أصل 5. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في Python Academy، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة Python Academy 5 دروس في المجموع.
ما التعلّم المعزّز؟
المفاهيم الأساسية في التعلّم المعزّز
التعلّم المعزّز (RL) هو أحد أنواع تعلّم الآلة، حيث يتعلم الوكيل اتخاذ القرارات من خلال التفاعل مع البيئة. والهدف هو تحقيق أكبر قدر ممكن من المكافآت بمرور الوقت.
تشمل المكونات الأساسية للتعلّم المعزّز الوكلاء والبيئات والمكافآت والعقوبات.

المصطلحات الأساسية في RL
المصطلحات الأساسية في RL
من المصطلحات المهمة في التعلّم المعزّز:
- الوكيل: الجهة التي تتخذ القرارات، مثل روبوت أو برنامج.
- البيئة: النظام الذي يتفاعل معه الوكيل.
- الحالة: الوضع الحالي للبيئة.
- الإجراء: القرار الذي يتخذه الوكيل.
- المكافأة: التغذية الراجعة التي تقدمها البيئة مقابل إجراء ما.
التفاعل بين الوكيل والبيئة
التفاعل بين الوكيل والبيئة
يمكن تلخيص التفاعل بين الوكيل والبيئة كما يلي:
- يراقب الوكيل الحالة الحالية للبيئة.
- يتخذ الوكيل إجراءً استنادًا إلى سياسة.
- تنتقل البيئة إلى حالة جديدة وتقدم مكافأة.
تستمر هذه الحلقة حتى الوصول إلى حالة نهائية.
المكافآت والعقوبات
المكافآت والعقوبات
المكافآت هي التغذية الراجعة التي يحصل عليها الوكيل مقابل إجراءاته. والهدف هو تعظيم المكافأة التراكمية بمرور الوقت. أما العقوبات فهي مكافآت سالبة تثني الوكيل عن الإجراءات غير المرغوبة.
على سبيل المثال:
- المكافأة: +10 عند الوصول إلى هدف.
- العقوبة: -5 عند الاصطدام بعائق.
السياسات في RL
السياسات في RL
السياسة هي استراتيجية يستخدمها الوكيل لتحديد الإجراءات استنادًا إلى الحالة الحالية.
أنواع السياسات:
- حتمية: تختار الإجراء نفسه دائمًا لحالة معينة.
- احتمالية: تختار الإجراءات باحتمالات مختلفة.
الاستكشاف مقابل الاستغلال
الاستكشاف مقابل الاستغلال
يواجه الوكيل مفاضلة بين ما يلي:
- الاستكشاف: تجربة إجراءات جديدة لاكتشاف المزيد عن البيئة.
- الاستغلال: اختيار الإجراءات التي تحقق أعلى مكافأة معروفة.
يُعد تحقيق التوازن بينهما أمرًا بالغ الأهمية للتعلّم الفعّال.
عملية قرار ماركوف (MDP)
عملية قرار ماركوف (MDP)
غالبًا ما تُنمذج مسائل التعلّم المعزّز على شكل عملية قرار ماركوف (MDP)، وتُعرّف كما يلي:
- الحالات (S): التكوينات الممكنة للبيئة.
- الإجراءات (A): الخيارات المتاحة للوكيل.
- المكافآت (R): التغذية الراجعة مقابل الإجراءات.
- احتمالات الانتقال (P): احتمال الانتقال بين الحالات.
التحديات في التعلّم المعزّز
التحديات في التعلّم المعزّز
يواجه التعلّم المعزّز بعض التحديات:
- المكافآت المتأخرة: قد يتم الحصول على المكافآت بعد تنفيذ عدة إجراءات.
- المكافآت المتناثرة: قد تحدث المكافآت على فترات متباعدة.
- الأبعاد العالية: بيئات معقدة تضم حالات وإجراءات كثيرة.
الملخص والخطوات التالية
الملخص والخطوات التالية
في هذا الدرس:
- استكشفنا المفاهيم الأساسية للتعلّم المعزّز، بما في ذلك الوكلاء والبيئات والمكافآت.
- ناقشنا السياسات والاستكشاف مقابل الاستغلال وعمليات قرار ماركوف (MDPs).
- تعرّفنا على تحديات التعلّم المعزّز.
سننتقل بعد ذلك إلى مفهوم جدول Q، وهو نهج أساسي في التعلّم المعزّز.

الأسئلة الشائعة
هل درس «المفاهيم الأساسية للتعلم المعزز» مجاني؟
نعم — نص درس «المفاهيم الأساسية للتعلم المعزز» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة Python Academy، انتقل إلى CoddyKit PRO. تتضمن دورة Python Academy 5 دروس في المجموع.
ماذا ستتعلم في «المفاهيم الأساسية للتعلم المعزز»؟
الوكيل والبيئة والمكافآت والعقوبات تتمرن على Python Academy مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ Python Academy؟
لا تُشترط خبرة سابقة. Python Academy على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 1 من أصل 5.
كم من الوقت يستغرق درس «المفاهيم الأساسية للتعلم المعزز»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس Python Academy هذا؟
نعم. كل درس في Python Academy يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.
جميع الدروس في هذه الدورة
- المفاهيم الأساسية للتعلم المعزز
- مفهوم جدول Q
- تطبيق جدول Q في Python
- التعلم المعزز العميق Q
- استكشاف OpenAI Gym