أوقف تسرّب البيانات قبل أن يبدأ
إبعاد معلومات الاختبار عن التدريب
أوقف تسرّب البيانات قبل أن يبدأ درس مجاني في Data Science Academy على CoddyKit. هذا هو الدرس 4 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في Data Science Academy، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة Data Science Academy 4 دروس في المجموع.
الغشاش الصامت
تسرّب البيانات هو تسلل معلومات الاختبار إلى التدريب. تبدو النتائج مذهلة، ثم تنهار في العالم الحقيقي.
لماذا يخدعك
يتيح التسرب للنموذج الاطلاع على إجابات لا ينبغي له رؤيتها. عندها تصبح نتيجة الاختبار وهمًا لا تنبؤًا بالأداء المستقبلي.
الخطأ الكلاسيكي
يؤدي تغيير المقياس أو ملء القيم في مجموعة البيانات كاملة قبل التقسيم إلى تسرب. فقد أثرت صفوف الاختبار خفيةً في إحصاءات المعالجة المسبقة.
درّب على بيانات التدريب فقط
احرص دائمًا على إجراء fit للمحوّلات باستخدام بيانات التدريب وحدها. تعلّم المتوسط أو المقياس أو قيمة الملء من التدريب، وليس من مجموعة الاختبار مطلقًا.
scaler.fit(X_train)ثم حوّل المجموعتين
بعد إجراء fit على بيانات التدريب، استخدم ببساطة transform لتحويل مجموعة الاختبار بالأرقام التي تعلّمها النموذج. تُعاد صياغة بيانات الاختبار دون الرجوع إليها.
X_train_s = scaler.transform(X_train)
X_test_s = scaler.transform(X_test)احذر تسرّب الهدف
هناك نوع أكثر خفاءً يُسمى تسرّب الهدف: ميزة ترمّز الإجابة سرًا، مثل استخدام مؤشر استرداد المبلغ للتنبؤ بعمليات استرداد المبلغ.
تتسرب معلومات المستقبل أيضًا
في البيانات الزمنية، يؤدي استخدام قيمة سُجلت بعد لحظة التنبؤ إلى تسريب المستقبل. استخدم فقط المعلومات المتاحة وقت اتخاذ القرار.
تحميك خطوط الأنابيب
اجمع المعالجة المسبقة والنموذج داخل Pipeline. فهي تعيد إجراء fit للتحويلات في كل طية تدريب، فتحجب التسرب تلقائيًا.
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(scaler, model)مصادقة متقاطعة آمنة
مرّر خط الأنابيب كاملًا إلى المصادقة المتقاطعة. عندها يتعلم تغيير المقياس داخل كل طية، فلا تلامس طية الاختبار عملية fit مطلقًا.
cross_val_score(pipe, X, y, cv=5)انتبه إلى الكمال المريب
النتيجة القريبة من الكمال علامة تحذير وليست وسامًا. فالمشكلات الحقيقية مليئة بالضوضاء، لذا تحقق قبل الاحتفال.
القاعدة الذهبية
كل ما يتعلمه النموذج من البيانات يجب أن يأتي من التدريب وحده. أبقِ مجموعة الاختبار مغلقة حتى التقييم النهائي الوحيد. 🔒
تحقق سريع
لقد غيّرت مقياس بياناتك. كيف تتجنب التسرب؟
مراجعة
يؤدي التسرب إلى تضخيم النتائج عبر تسريب الإجابات. أجرِ fit للتحويلات على بيانات التدريب فقط، واستخدم Pipeline، وأبقِ مجموعة الاختبار مغلقة. 🔒
تعلم Python مع معلم ذكاء اصطناعي — مجانًا
اكتب وقم بتشغيل أكوادك الفعلية في المتصفح، واحصل على مساعدة فورية من معلم ذكاء اصطناعي متاح 24/7، واستمر من حيث توقفت على الويب أو في التطبيق.
- الدورات
- 30
- الدروس
- 120
الأسئلة الشائعة
هل درس «أوقف تسرّب البيانات قبل أن يبدأ» مجاني؟
نعم — نص درس «أوقف تسرّب البيانات قبل أن يبدأ» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة Data Science Academy، انتقل إلى CoddyKit PRO. تتضمن دورة Data Science Academy 4 دروس في المجموع.
ماذا ستتعلم في «أوقف تسرّب البيانات قبل أن يبدأ»؟
إبعاد معلومات الاختبار عن التدريب تتمرن على Data Science Academy مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ Data Science Academy؟
لا تُشترط خبرة سابقة. Data Science Academy على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 4 من أصل 4.
كم من الوقت يستغرق درس «أوقف تسرّب البيانات قبل أن يبدأ»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس Data Science Academy هذا؟
نعم. كل درس في Data Science Academy يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.
جميع الدروس في هذه الدورة
- لماذا نحتفظ بمجموعة اختبار منفصلة
- استخدام train_test_split بالشكل الصحيح
- التحقق المتقاطع K-Fold
- أوقف تسرّب البيانات قبل أن يبدأ