Mettre les nombres à l’échelle et les normaliser
Placer les variables sur un pied d’égalité
Mettre les nombres à l’échelle et les normaliser est une leçon Data Science Academy gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Data Science Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Data Science Academy comprend 4 leçons au total.
Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.
Why Scale Numbers
Age ranges 0 to 90 while income ranges to millions. Without scaling, the bigger numbers dominate and quietly drown out the smaller ones. ⚖️
Distance-Based Models Care
Models that measure distance, like k-NN and k-means, are very sensitive to scale. Unscaled features hand all the power to the largest column.
Standardization
Standardization rescales a column to mean 0 and standard deviation 1. Values become how many standard deviations they sit from the average.
StandardScaler
The StandardScaler applies standardization for you. Fit it on your data, then transform any column into z-scores.
from sklearn.preprocessing import StandardScaler
z = StandardScaler().fit_transform(df[['age']])Normalization
Normalization squeezes values into a fixed range, usually 0 to 1. The smallest value maps to 0 and the largest to 1.
MinMaxScaler
Reach for MinMaxScaler to rescale into 0 to 1. It keeps the shape of your data while bounding the range.
from sklearn.preprocessing import MinMaxScaler
m = MinMaxScaler().fit_transform(df[['age']])Standardize or Normalize
Use standardization when data is roughly bell-shaped or has outliers. Pick normalization when you need a strict 0 to 1 bound.
Outliers Hurt MinMax
A single huge value can squash everything else near zero under MinMax. When outliers dominate, RobustScaler resists them better.
from sklearn.preprocessing import RobustScaler
r = RobustScaler().fit_transform(df[['income']])Fit on Train Only
Fit the scaler on training data alone, then transform the test set. Fitting on everything leaks test information into your model.
scaler.fit(X_train)
X_test_scaled = scaler.transform(X_test)Scale Inside a Pipeline
Bundle the scaler with your model in a Pipeline. It then fits only on the training fold during cross-validation, blocking leakage for free.
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), model)Trees Do Not Need It
Tree-based models like random forests split on thresholds, so scaling rarely changes results. Save scaling for distance and linear methods.
Quick Check
You need every feature rescaled to a strict 0-to-1 range. Which scaler fits?
Recap: Scaling
You put features on a fair footing: StandardScaler for z-scores, MinMaxScaler for 0 to 1, RobustScaler for outliers. Always fit on train only. 🎉
Questions Fréquemment Posées
La leçon « Mettre les nombres à l’échelle et les normaliser » est-elle gratuite ?
Oui — le texte complet de « Mettre les nombres à l’échelle et les normaliser » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Data Science Academy, passe à CoddyKit PRO. Le cours Data Science Academy comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Mettre les nombres à l’échelle et les normaliser » ?
Placer les variables sur un pied d’égalité Tu pratiques Data Science Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer Data Science Academy ?
Aucune expérience préalable n'est requise. Data Science Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.
Combien de temps prend la leçon « Mettre les nombres à l’échelle et les normaliser » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon Data Science Academy ?
Oui. Chaque leçon Data Science Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Regrouper les nombres en catégories
- Encoder les colonnes catégorielles
- Mettre les nombres à l’échelle et les normaliser
- Créer des variables à partir des dates et du texte