Ресэмплинг: SMOTE и уменьшение выборки
Балансировка обучающей выборки
«Ресэмплинг: SMOTE и уменьшение выборки» — бесплатный урок Data Science Academy на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Data Science Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Data Science Academy содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
Rebalance the Training Set
One way to help a model see the rare class is to resample: change how many examples of each class it trains on.
Two Directions to Balance
You can add more of the minority (oversample) or trim the majority (undersample). Both aim to even out the class counts.
Naive Oversampling
The simplest oversample just copies minority rows until counts match. It works, but those exact duplicates can make a model memorize them.
Enter SMOTE
SMOTE creates synthetic minority examples instead of copies. It invents new, plausible points between real minority neighbors.
How SMOTE Builds Points
SMOTE picks a minority row, finds a nearby minority neighbor, and places a fresh point somewhere on the line between them.
SMOTE in Code
The imbalanced-learn library makes SMOTE a two-line affair on your training features and labels.
from imblearn.over_sampling import SMOTE
X_res, y_res = SMOTE().fit_resample(X_train, y_train)Undersampling the Majority
Undersampling drops majority rows until balance returns. It trains faster but throws away data, which can cost real signal.
When to Pick Which
Oversample when data is scarce and every row matters. Undersample when the majority is huge and you can spare some rows for speed.
The Cardinal Rule
Resample only the training set. Touch the test set and your scores become fantasy, since real data is never rebalanced for you.
Fit on Train Only
SMOTE must learn from training rows alone. Leaking test rows into resampling inflates results and quietly causes data leakage. ⚠️
Resampling Is Not a Cure-All
Balanced counts help, but they are not magic. Pair resampling with the right metrics and sometimes class weights for the best results.
Quick Check
What makes SMOTE different from plain oversampling?
Recap
Resampling balances the training set by oversampling (SMOTE makes synthetic rows) or undersampling. Never resample the test set. 🎯
Часто задаваемые вопросы
Урок «Ресэмплинг: SMOTE и уменьшение выборки» бесплатный?
Да — полный текст урока «Ресэмплинг: SMOTE и уменьшение выборки» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Data Science Academy, подпишись на CoddyKit PRO. Курс Data Science Academy содержит 4 уроков всего.
Чему я научусь в уроке «Ресэмплинг: SMOTE и уменьшение выборки»?
Балансировка обучающей выборки Ты практикуешь Data Science Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать Data Science Academy?
Предыдущий опыт не требуется. Data Science Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.
Сколько времени занимает урок «Ресэмплинг: SMOTE и уменьшение выборки»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке Data Science Academy?
Да. Каждый урок Data Science Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Почему точность вводит в заблуждение при дисбалансе
- Ресэмплинг: SMOTE и уменьшение выборки
- Веса классов и пороги
- Выбор метрик для редких событий