Escalar y normalizar números
Poner las características en igualdad de condiciones.
Escalar y normalizar números es una lección gratuita de Data Science Academy en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Data Science Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Data Science Academy incluye 4 lecciones en total.
Partes de esta lección aún no han sido traducidas y se muestran en inglés.
Why Scale Numbers
Age ranges 0 to 90 while income ranges to millions. Without scaling, the bigger numbers dominate and quietly drown out the smaller ones. ⚖️
Distance-Based Models Care
Models that measure distance, like k-NN and k-means, are very sensitive to scale. Unscaled features hand all the power to the largest column.
Standardization
Standardization rescales a column to mean 0 and standard deviation 1. Values become how many standard deviations they sit from the average.
StandardScaler
The StandardScaler applies standardization for you. Fit it on your data, then transform any column into z-scores.
from sklearn.preprocessing import StandardScaler
z = StandardScaler().fit_transform(df[['age']])Normalization
Normalization squeezes values into a fixed range, usually 0 to 1. The smallest value maps to 0 and the largest to 1.
MinMaxScaler
Reach for MinMaxScaler to rescale into 0 to 1. It keeps the shape of your data while bounding the range.
from sklearn.preprocessing import MinMaxScaler
m = MinMaxScaler().fit_transform(df[['age']])Standardize or Normalize
Use standardization when data is roughly bell-shaped or has outliers. Pick normalization when you need a strict 0 to 1 bound.
Outliers Hurt MinMax
A single huge value can squash everything else near zero under MinMax. When outliers dominate, RobustScaler resists them better.
from sklearn.preprocessing import RobustScaler
r = RobustScaler().fit_transform(df[['income']])Fit on Train Only
Fit the scaler on training data alone, then transform the test set. Fitting on everything leaks test information into your model.
scaler.fit(X_train)
X_test_scaled = scaler.transform(X_test)Scale Inside a Pipeline
Bundle the scaler with your model in a Pipeline. It then fits only on the training fold during cross-validation, blocking leakage for free.
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), model)Trees Do Not Need It
Tree-based models like random forests split on thresholds, so scaling rarely changes results. Save scaling for distance and linear methods.
Quick Check
You need every feature rescaled to a strict 0-to-1 range. Which scaler fits?
Recap: Scaling
You put features on a fair footing: StandardScaler for z-scores, MinMaxScaler for 0 to 1, RobustScaler for outliers. Always fit on train only. 🎉
Preguntas frecuentes
¿La lección «Escalar y normalizar números» es gratis?
Sí — el texto completo de «Escalar y normalizar números» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Data Science Academy, actualiza a CoddyKit PRO. El curso de Data Science Academy incluye 4 lecciones en total.
¿Qué aprenderé en «Escalar y normalizar números»?
Poner las características en igualdad de condiciones. Practicas Data Science Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar Data Science Academy?
No se requiere experiencia previa. Data Science Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.
¿Cuánto tiempo toma la lección «Escalar y normalizar números»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de Data Science Academy?
Sí. Cada lección de Data Science Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Convertir números en categorías
- Codificar columnas categóricas
- Escalar y normalizar números
- Crear características a partir de fechas y texto