Zuerst skalieren, dann PCA anpassen
Warum Standardisierung hier wichtig ist
Zuerst skalieren, dann PCA anpassen ist eine kostenlose Data Science Academy-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Data Science Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Data Science Academy-Kurs umfasst insgesamt 4 Lektionen.
Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.
PCA Cares About Scale
PCA chases the largest variance, but variance depends on units. A feature in big numbers can dominate just because of its scale.
A Unit Trap
Imagine salary in dollars beside age in years. Salary varies in thousands, so PCA would treat it as far more important, unfairly.
Standardize First
The fix is standardization: rescale every feature to mean zero and unit variance so each starts on equal footing.
Use StandardScaler
In scikit-learn, StandardScaler centers and scales your columns before PCA ever sees them.
from sklearn.preprocessing import StandardScaler
Xs = StandardScaler().fit_transform(X)Then Fit PCA
Run PCA on the scaled data, never the raw data. Now each component reflects real structure, not lopsided units.
from sklearn.decomposition import PCA
scores = PCA(n_components=2).fit_transform(Xs)Centering Matters Too
PCA assumes data is centered at zero. Standardizing handles this by subtracting each column mean, so axes pass through the data center.
Chain It in a Pipeline
Wrap the scaler and PCA in a Pipeline so scaling always happens first and never leaks across your data splits.
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), PCA(2))Fit on Train Only
Fit the scaler on training data, then reuse it on test data. Fitting on everything leaks information and inflates your scores.
When You May Skip It
If every feature already shares the same unit and range, scaling matters less. When unsure, standardize anyway; it rarely hurts.
Watch the Difference
Run PCA with and without scaling on mixed-unit data. The explained variance and top components will look strikingly different.
Robust Options Exist
With strong outliers, consider RobustScaler, which uses medians and quartiles so extreme points sway PCA less.
from sklearn.preprocessing import RobustScalerQuick Check
One step almost always comes right before PCA.
Recap
PCA is scale-sensitive, so standardize first, fit on training data only, and a pipeline keeps the order safe. 🎯
Häufig gestellte Fragen
Ist die Lektion „Zuerst skalieren, dann PCA anpassen“ kostenlos?
Ja — der vollständige Text von „Zuerst skalieren, dann PCA anpassen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Data Science Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Data Science Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Zuerst skalieren, dann PCA anpassen“?
Warum Standardisierung hier wichtig ist Du übst Data Science Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um Data Science Academy zu starten?
Keine Vorkenntnisse erforderlich. Data Science Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.
Wie lange dauert die Lektion „Zuerst skalieren, dann PCA anpassen“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser Data Science Academy-Lektion Code schreiben und ausführen?
Ja. Jede Data Science Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Der Fluch zu vieler Merkmale
- Wie PCA Komponenten findet
- Zuerst skalieren, dann PCA anpassen
- Komponenten mit Scree-Plots auswählen