0Pricing
Data Science Academy · درس

حجّم البيانات أولًا ثم طبّق PCA

لماذا يهم التوحيد هنا

حجّم البيانات أولًا ثم طبّق PCA درس مجاني في Data Science Academy على CoddyKit. هذا هو الدرس 3 من أصل 4. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في Data Science Academy، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة Data Science Academy 4 دروس في المجموع.

بعض أجزاء هذا الدرس لم تُترجم بعد وتظهر باللغة الإنجليزية.

PCA Cares About Scale

PCA chases the largest variance, but variance depends on units. A feature in big numbers can dominate just because of its scale.

A Unit Trap

Imagine salary in dollars beside age in years. Salary varies in thousands, so PCA would treat it as far more important, unfairly.

Standardize First

The fix is standardization: rescale every feature to mean zero and unit variance so each starts on equal footing.

Use StandardScaler

In scikit-learn, StandardScaler centers and scales your columns before PCA ever sees them.

from sklearn.preprocessing import StandardScaler
Xs = StandardScaler().fit_transform(X)

Then Fit PCA

Run PCA on the scaled data, never the raw data. Now each component reflects real structure, not lopsided units.

from sklearn.decomposition import PCA
scores = PCA(n_components=2).fit_transform(Xs)

Centering Matters Too

PCA assumes data is centered at zero. Standardizing handles this by subtracting each column mean, so axes pass through the data center.

Chain It in a Pipeline

Wrap the scaler and PCA in a Pipeline so scaling always happens first and never leaks across your data splits.

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), PCA(2))

Fit on Train Only

Fit the scaler on training data, then reuse it on test data. Fitting on everything leaks information and inflates your scores.

When You May Skip It

If every feature already shares the same unit and range, scaling matters less. When unsure, standardize anyway; it rarely hurts.

Watch the Difference

Run PCA with and without scaling on mixed-unit data. The explained variance and top components will look strikingly different.

Robust Options Exist

With strong outliers, consider RobustScaler, which uses medians and quartiles so extreme points sway PCA less.

from sklearn.preprocessing import RobustScaler

Quick Check

One step almost always comes right before PCA.

Recap

PCA is scale-sensitive, so standardize first, fit on training data only, and a pipeline keeps the order safe. 🎯

الأسئلة الشائعة

هل درس «حجّم البيانات أولًا ثم طبّق PCA» مجاني؟

نعم — نص درس «حجّم البيانات أولًا ثم طبّق PCA» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة Data Science Academy، انتقل إلى CoddyKit PRO. تتضمن دورة Data Science Academy 4 دروس في المجموع.

ماذا ستتعلم في «حجّم البيانات أولًا ثم طبّق PCA»؟

لماذا يهم التوحيد هنا تتمرن على Data Science Academy مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.

هل أحتاج إلى خبرة سابقة لأبدأ Data Science Academy؟

لا تُشترط خبرة سابقة. Data Science Academy على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 3 من أصل 4.

كم من الوقت يستغرق درس «حجّم البيانات أولًا ثم طبّق PCA»؟

معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.

هل يمكنني كتابة وتشغيل أكواد في درس Data Science Academy هذا؟

نعم. كل درس في Data Science Academy يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.

جميع الدروس في هذه الدورة

  1. لعنة كثرة الميزات
  2. كيف يعثر PCA على المكوّنات
  3. حجّم البيانات أولًا ثم طبّق PCA
  4. اختيار المكوّنات باستخدام مخططات Scree
← العودة إلى Data Science Academy