Reamostragem: SMOTE e subamostragem
Reequilibrando o conjunto de treinamento.
Reamostragem: SMOTE e subamostragem é uma aula grátis de Data Science Academy no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Data Science Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Data Science Academy inclui 4 aulas no total.
Partes desta aula ainda não foram traduzidas e aparecem em inglês.
Rebalance the Training Set
One way to help a model see the rare class is to resample: change how many examples of each class it trains on.
Two Directions to Balance
You can add more of the minority (oversample) or trim the majority (undersample). Both aim to even out the class counts.
Naive Oversampling
The simplest oversample just copies minority rows until counts match. It works, but those exact duplicates can make a model memorize them.
Enter SMOTE
SMOTE creates synthetic minority examples instead of copies. It invents new, plausible points between real minority neighbors.
How SMOTE Builds Points
SMOTE picks a minority row, finds a nearby minority neighbor, and places a fresh point somewhere on the line between them.
SMOTE in Code
The imbalanced-learn library makes SMOTE a two-line affair on your training features and labels.
from imblearn.over_sampling import SMOTE
X_res, y_res = SMOTE().fit_resample(X_train, y_train)Undersampling the Majority
Undersampling drops majority rows until balance returns. It trains faster but throws away data, which can cost real signal.
When to Pick Which
Oversample when data is scarce and every row matters. Undersample when the majority is huge and you can spare some rows for speed.
The Cardinal Rule
Resample only the training set. Touch the test set and your scores become fantasy, since real data is never rebalanced for you.
Fit on Train Only
SMOTE must learn from training rows alone. Leaking test rows into resampling inflates results and quietly causes data leakage. ⚠️
Resampling Is Not a Cure-All
Balanced counts help, but they are not magic. Pair resampling with the right metrics and sometimes class weights for the best results.
Quick Check
What makes SMOTE different from plain oversampling?
Recap
Resampling balances the training set by oversampling (SMOTE makes synthetic rows) or undersampling. Never resample the test set. 🎯
Perguntas Frequentes
A aula “Reamostragem: SMOTE e subamostragem” é grátis?
Sim — o texto completo de “Reamostragem: SMOTE e subamostragem” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Data Science Academy, atualize para CoddyKit PRO. O curso de Data Science Academy inclui 4 aulas no total.
O que vou aprender em “Reamostragem: SMOTE e subamostragem”?
Reequilibrando o conjunto de treinamento. Você pratica Data Science Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar Data Science Academy?
Nenhuma experiência prévia é necessária. Data Science Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.
Quanto tempo leva a aula “Reamostragem: SMOTE e subamostragem”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de Data Science Academy?
Sim. Cada aula de Data Science Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Por que a acurácia engana em dados desbalanceados
- Reamostragem: SMOTE e subamostragem
- Pesos de classe e limiares
- Escolher métricas para eventos raros