NLP Academy · درس

لماذا تُهمَل الفئات النادرة

تكلفة تسميات الفئات غير المتوازنة

الدرس 1 من 413 خطوة

لماذا تُهمَل الفئات النادرة درس مجاني في NLP Academy على CoddyKit. هذا هو الدرس 1 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في NLP Academy، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة NLP Academy 4 دروس في المجموع.

تعريف عدم التوازن

عندما يفوق عدد إحدى التسميات عدد تسمية أخرى بكثير، تكون بياناتك غير متوازنة. تخيّل 9500 رسالة عادية مقابل 500 رسالة مزعجة.

الاختصار السهل

يريد النموذج تحقيق دقة عالية بسرعة. والطريقة السهلة هي التنبؤ دائمًا بالفئة الأكبر وتجاهل الفئة النادرة بهدوء. 😬

دقة 95% لا تعني شيئًا

مع كون الرسائل المزعجة تمثل 5%، يحقق النموذج الذي يصنّف كل الرسائل على أنها عادية دقة قدرها 95%، لكنه لا يكتشف أي رسالة مزعجة. هذا الرقم بلا قيمة.

لماذا تتفق دالة الخسارة

يقلل التدريب المعتاد الخطأ الكلي. وبما أن أخطاء الفئة النادرة قليلة، فلا تتغير دالة الخسارة كثيرًا عندما يتجاهلها النموذج.

الفئة الأكبر مقابل الأصغر

نسمّي المجموعة الكبيرة الفئة الأكبر، والصغيرة الفئة الأصغر. وغالبًا ما تهتم معالجة اللغة الطبيعية بالفئة الأصغر أكثر من غيرها.

لاحظ الانحراف

أحصِ تسمياتك قبل بناء النموذج. يكشف سطر واحد مدى انحراف توزيع الفئات فعليًا.

from collections import Counter
print(Counter(labels))

التكلفة الحقيقية

قد تكون الرسالة المزعجة أو الاحتيالية أو المسيئة التي لم يكتشفها النموذج مكلفة. وفي معالجة اللغة الطبيعية، تكون الفئة النادرة عادةً هي الفئة التي بنيت النموذج لاكتشافها.

تنجرف حدود القرار

عندما يكون عدد نقاط الفئة الأصغر قليلًا، تنجرف حدود القرار نحو المجموعة الأكبر، فتبتلع المنطقة النادرة بأكملها تقريبًا.

الدقة ليست المقياس المناسب

تخفي الدقة الإخفاق عند التعامل مع بيانات منحازة. أنت بحاجة إلى مقاييس تبرز الفئة النادرة، مثل الاستدعاء للفئة الأصغر.

حدّد نسبة عدم التوازن

توضح نسبة عدم التوازن بسرعة مدى شدته. النسبة عشرة إلى واحد بسيطة، أما النسبة ألف إلى واحد فتتطلب عناية كبيرة.

ratio = counts.max() / counts.min()
print(round(ratio, 1))

شخّص المشكلة قبل إصلاحها

تسمية المشكلة نصف الحل. وبمجرد أن تلاحظ الانحراف، يمكنك اختيار إعادة أخذ العينات أو استخدام الأوزان لمعالجته.

تحقق سريع

لنختبر الفكرة الأساسية وراء عدم التوازن.

مراجعة

تسمح البيانات غير المتوازنة للنماذج بتجاهل الفئة النادرة مع تحقيق دقة عالية. لاحظ الانحراف أولًا، ثم أصلحه. ✅

البدء مجانًا

تعلم Python مع معلم ذكاء اصطناعي — مجانًا

اكتب وقم بتشغيل أكوادك الفعلية في المتصفح، واحصل على مساعدة فورية من معلم ذكاء اصطناعي متاح 24/7، واستمر من حيث توقفت على الويب أو في التطبيق.

الدورات
30
الدروس
120

الأسئلة الشائعة

هل درس «لماذا تُهمَل الفئات النادرة» مجاني؟

نعم — نص درس «لماذا تُهمَل الفئات النادرة» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة NLP Academy، انتقل إلى CoddyKit PRO. تتضمن دورة NLP Academy 4 دروس في المجموع.

ماذا ستتعلم في «لماذا تُهمَل الفئات النادرة»؟

تكلفة تسميات الفئات غير المتوازنة تتمرن على NLP Academy مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.

هل أحتاج إلى خبرة سابقة لأبدأ NLP Academy؟

لا تُشترط خبرة سابقة. NLP Academy على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 1 من أصل 4.

كم من الوقت يستغرق درس «لماذا تُهمَل الفئات النادرة»؟

معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.

هل يمكنني كتابة وتشغيل أكواد في درس NLP Academy هذا؟

نعم. كل درس في NLP Academy يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.

جميع الدروس في هذه الدورة

  1. لماذا تُهمَل الفئات النادرة
  2. إعادة أخذ العينات وأوزان الفئات
  3. اختيار العتبة والمقياس
  4. مسار متكامل للفئات غير المتوازنة
← العودة إلى NLP Academy