Rééchantillonnage et poids des classes
Rééquilibrer avec du code, sans davantage de données
Rééchantillonnage et poids des classes est une leçon NLP Academy gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage NLP Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours NLP Academy comprend 4 leçons au total.
Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.
Two Ways to Rebalance
You can fix skew by changing the data with resampling, or by changing the math with class weights. Both nudge attention to the rare class.
Oversampling the Minority
Oversampling copies or synthesizes more rare examples so the classes meet in the middle, giving the model more to learn from.
Undersampling the Majority
Undersampling drops some majority examples instead. It is fast and lean, but you risk throwing away useful signal.
SMOTE for Text Features
SMOTE invents new minority points between real ones in feature space, rather than duplicating, so the model sees fresh variety.
from imblearn.over_sampling import SMOTE
X_bal, y_bal = SMOTE().fit_resample(X, y)Resample Training Only
Always rebalance the training set alone. Touching your test set fakes good scores and hides the real performance.
The Weighting Idea
Instead of moving data, you can make each rare mistake hurt more. Higher class weights push the loss to respect the minority.
Balanced in One Line
Many scikit-learn models accept class_weight. Set it to balanced and weights are computed inversely to class frequency.
clf = LogisticRegression(class_weight='balanced')How Balanced Weights Work
Balanced weighting scales each class by the inverse of its frequency, so a rare label effectively counts many times more.
Weights vs Resampling
Class weights are cheap and keep your data intact, while resampling can capture richer patterns. Try weights first.
Watch for Overfitting
Aggressive oversampling can make a model memorize rare examples. Validate on untouched data to catch this overfitting early.
Pick One, Measure It
There is no universal winner. Choose a method, then judge it by minority recall, not by raw accuracy. 🎯
Quick Check
Pick the safest rebalancing habit.
Recap
Fight skew with resampling or class weights, rebalance training data only, and judge results on minority recall. ✅
Questions Fréquemment Posées
La leçon « Rééchantillonnage et poids des classes » est-elle gratuite ?
Oui — le texte complet de « Rééchantillonnage et poids des classes » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours NLP Academy, passe à CoddyKit PRO. Le cours NLP Academy comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Rééchantillonnage et poids des classes » ?
Rééquilibrer avec du code, sans davantage de données Tu pratiques NLP Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer NLP Academy ?
Aucune expérience préalable n'est requise. NLP Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.
Combien de temps prend la leçon « Rééchantillonnage et poids des classes » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon NLP Academy ?
Oui. Chaque leçon NLP Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Pourquoi les classes rares sont ignorées
- Rééchantillonnage et poids des classes
- Choisir le seuil et la métrique
- Pipeline de bout en bout pour les données déséquilibrées