0Pricing
Data Science Academy · Lekcja

Resampling: SMOTE i undersampling

Równoważenie zbioru treningowego

Resampling: SMOTE i undersampling to bezpłatna lekcja Data Science Academy na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Data Science Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Data Science Academy zawiera 4 lekcji w sumie.

Części tej lekcji nie zostały jeszcze przetłumaczone i są wyświetlane po angielsku.

Rebalance the Training Set

One way to help a model see the rare class is to resample: change how many examples of each class it trains on.

Two Directions to Balance

You can add more of the minority (oversample) or trim the majority (undersample). Both aim to even out the class counts.

Naive Oversampling

The simplest oversample just copies minority rows until counts match. It works, but those exact duplicates can make a model memorize them.

Enter SMOTE

SMOTE creates synthetic minority examples instead of copies. It invents new, plausible points between real minority neighbors.

How SMOTE Builds Points

SMOTE picks a minority row, finds a nearby minority neighbor, and places a fresh point somewhere on the line between them.

SMOTE in Code

The imbalanced-learn library makes SMOTE a two-line affair on your training features and labels.

from imblearn.over_sampling import SMOTE
X_res, y_res = SMOTE().fit_resample(X_train, y_train)

Undersampling the Majority

Undersampling drops majority rows until balance returns. It trains faster but throws away data, which can cost real signal.

When to Pick Which

Oversample when data is scarce and every row matters. Undersample when the majority is huge and you can spare some rows for speed.

The Cardinal Rule

Resample only the training set. Touch the test set and your scores become fantasy, since real data is never rebalanced for you.

Fit on Train Only

SMOTE must learn from training rows alone. Leaking test rows into resampling inflates results and quietly causes data leakage. ⚠️

Resampling Is Not a Cure-All

Balanced counts help, but they are not magic. Pair resampling with the right metrics and sometimes class weights for the best results.

Quick Check

What makes SMOTE different from plain oversampling?

Recap

Resampling balances the training set by oversampling (SMOTE makes synthetic rows) or undersampling. Never resample the test set. 🎯

Często zadawane pytania

Czy lekcja „Resampling: SMOTE i undersampling” jest bezpłatna?

Tak — pełny tekst „Resampling: SMOTE i undersampling” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Data Science Academy, przejdź na CoddyKit PRO. Kurs Data Science Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Resampling: SMOTE i undersampling”?

Równoważenie zbioru treningowego Ćwiczysz Data Science Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć Data Science Academy?

Nie wymagamy żadnego doświadczenia. Data Science Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.

Ile czasu zajmuje lekcja „Resampling: SMOTE i undersampling”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji Data Science Academy?

Tak. Każda lekcja Data Science Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Dlaczego accuracy zawodzi przy niezbalansowanych danych
  2. Resampling: SMOTE i undersampling
  3. Wagi klas i progi
  4. Dobór metryk dla rzadkich zdarzeń
← Powrót do Data Science Academy