Передискретизация и веса классов
Сбалансируйте классы с помощью кода, а не дополнительных данных
«Передискретизация и веса классов» — бесплатный урок NLP Academy на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения NLP Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс NLP Academy содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
Two Ways to Rebalance
You can fix skew by changing the data with resampling, or by changing the math with class weights. Both nudge attention to the rare class.
Oversampling the Minority
Oversampling copies or synthesizes more rare examples so the classes meet in the middle, giving the model more to learn from.
Undersampling the Majority
Undersampling drops some majority examples instead. It is fast and lean, but you risk throwing away useful signal.
SMOTE for Text Features
SMOTE invents new minority points between real ones in feature space, rather than duplicating, so the model sees fresh variety.
from imblearn.over_sampling import SMOTE
X_bal, y_bal = SMOTE().fit_resample(X, y)Resample Training Only
Always rebalance the training set alone. Touching your test set fakes good scores and hides the real performance.
The Weighting Idea
Instead of moving data, you can make each rare mistake hurt more. Higher class weights push the loss to respect the minority.
Balanced in One Line
Many scikit-learn models accept class_weight. Set it to balanced and weights are computed inversely to class frequency.
clf = LogisticRegression(class_weight='balanced')How Balanced Weights Work
Balanced weighting scales each class by the inverse of its frequency, so a rare label effectively counts many times more.
Weights vs Resampling
Class weights are cheap and keep your data intact, while resampling can capture richer patterns. Try weights first.
Watch for Overfitting
Aggressive oversampling can make a model memorize rare examples. Validate on untouched data to catch this overfitting early.
Pick One, Measure It
There is no universal winner. Choose a method, then judge it by minority recall, not by raw accuracy. 🎯
Quick Check
Pick the safest rebalancing habit.
Recap
Fight skew with resampling or class weights, rebalance training data only, and judge results on minority recall. ✅
Часто задаваемые вопросы
Урок «Передискретизация и веса классов» бесплатный?
Да — полный текст урока «Передискретизация и веса классов» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс NLP Academy, подпишись на CoddyKit PRO. Курс NLP Academy содержит 4 уроков всего.
Чему я научусь в уроке «Передискретизация и веса классов»?
Сбалансируйте классы с помощью кода, а не дополнительных данных Ты практикуешь NLP Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать NLP Academy?
Предыдущий опыт не требуется. NLP Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.
Сколько времени занимает урок «Передискретизация и веса классов»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке NLP Academy?
Да. Каждый урок NLP Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Почему редкие классы игнорируются
- Передискретизация и веса классов
- Выбор порога и метрики
- Сквозной конвейер для несбалансированных данных