0Pricing
Data Science Academy · Aula

Reamostragem: SMOTE e subamostragem

Reequilibrando o conjunto de treinamento.

Reamostragem: SMOTE e subamostragem é uma aula grátis de Data Science Academy no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Data Science Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Data Science Academy inclui 4 aulas no total.

Partes desta aula ainda não foram traduzidas e aparecem em inglês.

Rebalance the Training Set

One way to help a model see the rare class is to resample: change how many examples of each class it trains on.

Two Directions to Balance

You can add more of the minority (oversample) or trim the majority (undersample). Both aim to even out the class counts.

Naive Oversampling

The simplest oversample just copies minority rows until counts match. It works, but those exact duplicates can make a model memorize them.

Enter SMOTE

SMOTE creates synthetic minority examples instead of copies. It invents new, plausible points between real minority neighbors.

How SMOTE Builds Points

SMOTE picks a minority row, finds a nearby minority neighbor, and places a fresh point somewhere on the line between them.

SMOTE in Code

The imbalanced-learn library makes SMOTE a two-line affair on your training features and labels.

from imblearn.over_sampling import SMOTE
X_res, y_res = SMOTE().fit_resample(X_train, y_train)

Undersampling the Majority

Undersampling drops majority rows until balance returns. It trains faster but throws away data, which can cost real signal.

When to Pick Which

Oversample when data is scarce and every row matters. Undersample when the majority is huge and you can spare some rows for speed.

The Cardinal Rule

Resample only the training set. Touch the test set and your scores become fantasy, since real data is never rebalanced for you.

Fit on Train Only

SMOTE must learn from training rows alone. Leaking test rows into resampling inflates results and quietly causes data leakage. ⚠️

Resampling Is Not a Cure-All

Balanced counts help, but they are not magic. Pair resampling with the right metrics and sometimes class weights for the best results.

Quick Check

What makes SMOTE different from plain oversampling?

Recap

Resampling balances the training set by oversampling (SMOTE makes synthetic rows) or undersampling. Never resample the test set. 🎯

Perguntas Frequentes

A aula “Reamostragem: SMOTE e subamostragem” é grátis?

Sim — o texto completo de “Reamostragem: SMOTE e subamostragem” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Data Science Academy, atualize para CoddyKit PRO. O curso de Data Science Academy inclui 4 aulas no total.

O que vou aprender em “Reamostragem: SMOTE e subamostragem”?

Reequilibrando o conjunto de treinamento. Você pratica Data Science Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar Data Science Academy?

Nenhuma experiência prévia é necessária. Data Science Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.

Quanto tempo leva a aula “Reamostragem: SMOTE e subamostragem”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de Data Science Academy?

Sim. Cada aula de Data Science Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Por que a acurácia engana em dados desbalanceados
  2. Reamostragem: SMOTE e subamostragem
  3. Pesos de classe e limiares
  4. Escolher métricas para eventos raros
← Voltar para Data Science Academy