Dimensionar e normalizar números
Colocando os recursos em uma base justa.
Dimensionar e normalizar números é uma aula grátis de Data Science Academy no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Data Science Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Data Science Academy inclui 4 aulas no total.
Partes desta aula ainda não foram traduzidas e aparecem em inglês.
Why Scale Numbers
Age ranges 0 to 90 while income ranges to millions. Without scaling, the bigger numbers dominate and quietly drown out the smaller ones. ⚖️
Distance-Based Models Care
Models that measure distance, like k-NN and k-means, are very sensitive to scale. Unscaled features hand all the power to the largest column.
Standardization
Standardization rescales a column to mean 0 and standard deviation 1. Values become how many standard deviations they sit from the average.
StandardScaler
The StandardScaler applies standardization for you. Fit it on your data, then transform any column into z-scores.
from sklearn.preprocessing import StandardScaler
z = StandardScaler().fit_transform(df[['age']])Normalization
Normalization squeezes values into a fixed range, usually 0 to 1. The smallest value maps to 0 and the largest to 1.
MinMaxScaler
Reach for MinMaxScaler to rescale into 0 to 1. It keeps the shape of your data while bounding the range.
from sklearn.preprocessing import MinMaxScaler
m = MinMaxScaler().fit_transform(df[['age']])Standardize or Normalize
Use standardization when data is roughly bell-shaped or has outliers. Pick normalization when you need a strict 0 to 1 bound.
Outliers Hurt MinMax
A single huge value can squash everything else near zero under MinMax. When outliers dominate, RobustScaler resists them better.
from sklearn.preprocessing import RobustScaler
r = RobustScaler().fit_transform(df[['income']])Fit on Train Only
Fit the scaler on training data alone, then transform the test set. Fitting on everything leaks test information into your model.
scaler.fit(X_train)
X_test_scaled = scaler.transform(X_test)Scale Inside a Pipeline
Bundle the scaler with your model in a Pipeline. It then fits only on the training fold during cross-validation, blocking leakage for free.
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), model)Trees Do Not Need It
Tree-based models like random forests split on thresholds, so scaling rarely changes results. Save scaling for distance and linear methods.
Quick Check
You need every feature rescaled to a strict 0-to-1 range. Which scaler fits?
Recap: Scaling
You put features on a fair footing: StandardScaler for z-scores, MinMaxScaler for 0 to 1, RobustScaler for outliers. Always fit on train only. 🎉
Perguntas Frequentes
A aula “Dimensionar e normalizar números” é grátis?
Sim — o texto completo de “Dimensionar e normalizar números” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Data Science Academy, atualize para CoddyKit PRO. O curso de Data Science Academy inclui 4 aulas no total.
O que vou aprender em “Dimensionar e normalizar números”?
Colocando os recursos em uma base justa. Você pratica Data Science Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar Data Science Academy?
Nenhuma experiência prévia é necessária. Data Science Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.
Quanto tempo leva a aula “Dimensionar e normalizar números”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de Data Science Academy?
Sim. Cada aula de Data Science Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Transformar números em categorias
- Codificar colunas categóricas
- Dimensionar e normalizar números
- Criar recursos a partir de datas e textos