0Pricing
NLP Academy · Leçon

Rééchantillonnage et poids des classes

Rééquilibrer avec du code, sans davantage de données

Rééchantillonnage et poids des classes est une leçon NLP Academy gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage NLP Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours NLP Academy comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

Two Ways to Rebalance

You can fix skew by changing the data with resampling, or by changing the math with class weights. Both nudge attention to the rare class.

Oversampling the Minority

Oversampling copies or synthesizes more rare examples so the classes meet in the middle, giving the model more to learn from.

Undersampling the Majority

Undersampling drops some majority examples instead. It is fast and lean, but you risk throwing away useful signal.

SMOTE for Text Features

SMOTE invents new minority points between real ones in feature space, rather than duplicating, so the model sees fresh variety.

from imblearn.over_sampling import SMOTE
X_bal, y_bal = SMOTE().fit_resample(X, y)

Resample Training Only

Always rebalance the training set alone. Touching your test set fakes good scores and hides the real performance.

The Weighting Idea

Instead of moving data, you can make each rare mistake hurt more. Higher class weights push the loss to respect the minority.

Balanced in One Line

Many scikit-learn models accept class_weight. Set it to balanced and weights are computed inversely to class frequency.

clf = LogisticRegression(class_weight='balanced')

How Balanced Weights Work

Balanced weighting scales each class by the inverse of its frequency, so a rare label effectively counts many times more.

Weights vs Resampling

Class weights are cheap and keep your data intact, while resampling can capture richer patterns. Try weights first.

Watch for Overfitting

Aggressive oversampling can make a model memorize rare examples. Validate on untouched data to catch this overfitting early.

Pick One, Measure It

There is no universal winner. Choose a method, then judge it by minority recall, not by raw accuracy. 🎯

Quick Check

Pick the safest rebalancing habit.

Recap

Fight skew with resampling or class weights, rebalance training data only, and judge results on minority recall. ✅

Questions Fréquemment Posées

La leçon « Rééchantillonnage et poids des classes » est-elle gratuite ?

Oui — le texte complet de « Rééchantillonnage et poids des classes » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours NLP Academy, passe à CoddyKit PRO. Le cours NLP Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Rééchantillonnage et poids des classes » ?

Rééquilibrer avec du code, sans davantage de données Tu pratiques NLP Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer NLP Academy ?

Aucune expérience préalable n'est requise. NLP Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.

Combien de temps prend la leçon « Rééchantillonnage et poids des classes » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon NLP Academy ?

Oui. Chaque leçon NLP Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Pourquoi les classes rares sont ignorées
  2. Rééchantillonnage et poids des classes
  3. Choisir le seuil et la métrique
  4. Pipeline de bout en bout pour les données déséquilibrées
← Retour à NLP Academy