0Pricing
Data Science Academy · Lektion

Zahlen skalieren und normalisieren

Merkmale auf eine faire Vergleichsbasis bringen

Zahlen skalieren und normalisieren ist eine kostenlose Data Science Academy-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Data Science Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Data Science Academy-Kurs umfasst insgesamt 4 Lektionen.

Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.

Why Scale Numbers

Age ranges 0 to 90 while income ranges to millions. Without scaling, the bigger numbers dominate and quietly drown out the smaller ones. ⚖️

Distance-Based Models Care

Models that measure distance, like k-NN and k-means, are very sensitive to scale. Unscaled features hand all the power to the largest column.

Standardization

Standardization rescales a column to mean 0 and standard deviation 1. Values become how many standard deviations they sit from the average.

StandardScaler

The StandardScaler applies standardization for you. Fit it on your data, then transform any column into z-scores.

from sklearn.preprocessing import StandardScaler
z = StandardScaler().fit_transform(df[['age']])

Normalization

Normalization squeezes values into a fixed range, usually 0 to 1. The smallest value maps to 0 and the largest to 1.

MinMaxScaler

Reach for MinMaxScaler to rescale into 0 to 1. It keeps the shape of your data while bounding the range.

from sklearn.preprocessing import MinMaxScaler
m = MinMaxScaler().fit_transform(df[['age']])

Standardize or Normalize

Use standardization when data is roughly bell-shaped or has outliers. Pick normalization when you need a strict 0 to 1 bound.

Outliers Hurt MinMax

A single huge value can squash everything else near zero under MinMax. When outliers dominate, RobustScaler resists them better.

from sklearn.preprocessing import RobustScaler
r = RobustScaler().fit_transform(df[['income']])

Fit on Train Only

Fit the scaler on training data alone, then transform the test set. Fitting on everything leaks test information into your model.

scaler.fit(X_train)
X_test_scaled = scaler.transform(X_test)

Scale Inside a Pipeline

Bundle the scaler with your model in a Pipeline. It then fits only on the training fold during cross-validation, blocking leakage for free.

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), model)

Trees Do Not Need It

Tree-based models like random forests split on thresholds, so scaling rarely changes results. Save scaling for distance and linear methods.

Quick Check

You need every feature rescaled to a strict 0-to-1 range. Which scaler fits?

Recap: Scaling

You put features on a fair footing: StandardScaler for z-scores, MinMaxScaler for 0 to 1, RobustScaler for outliers. Always fit on train only. 🎉

Häufig gestellte Fragen

Ist die Lektion „Zahlen skalieren und normalisieren“ kostenlos?

Ja — der vollständige Text von „Zahlen skalieren und normalisieren“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Data Science Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Data Science Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Zahlen skalieren und normalisieren“?

Merkmale auf eine faire Vergleichsbasis bringen Du übst Data Science Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Data Science Academy zu starten?

Keine Vorkenntnisse erforderlich. Data Science Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.

Wie lange dauert die Lektion „Zahlen skalieren und normalisieren“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Data Science Academy-Lektion Code schreiben und ausführen?

Ja. Jede Data Science Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Zahlen in Kategorien einteilen
  2. Kategorische Spalten codieren
  3. Zahlen skalieren und normalisieren
  4. Merkmale aus Datumsangaben und Text erstellen
← Zurück zu Data Science Academy