Dlaczego accuracy zawodzi przy niezbalansowanych danych
Pułapka rzadkiej klasy
Dlaczego accuracy zawodzi przy niezbalansowanych danych to bezpłatna lekcja Data Science Academy na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Data Science Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Data Science Academy zawiera 4 lekcji w sumie.
Części tej lekcji nie zostały jeszcze przetłumaczone i są wyświetlane po angielsku.
The Comfortable Lie
Accuracy feels like the obvious score: how many predictions you got right. On balanced data it works fine, but imbalance quietly breaks it.
What Imbalance Means
A dataset is imbalanced when one class is far rarer than the others. Think fraud, disease, or churn: the interesting event is the rare one.
The 99% Trap
Imagine 99 normal transactions for every 1 fraud. A model that screams normal every single time scores a glorious 99% accuracy. ⚠️
Yet It Caught Nothing
That 99% model never flagged a single fraud. The number looks elite, but the model is useless for the exact job you hired it to do.
Accuracy Hides the Rare Class
Accuracy averages over all rows, so the huge majority drowns out the tiny minority. The rare class can be a total failure and barely move the score.
The Baseline You Must Beat
Always compare against the majority-class baseline: just predict the most common label. If your model cannot beat it, it learned nothing useful.
A Quick Reality Check
Before celebrating, ask one thing: what fraction of rows is the majority class? That number is the accuracy a lazy model gets for free.
See It With value_counts
One line reveals how lopsided your labels are. If one value dwarfs the rest, accuracy alone will mislead you.
counts = y.value_counts(normalize=True)
print(counts) # share of each classWhere the Cost Really Lives
Missing the rare class usually hurts most: an undetected tumor or fraud is costly. Accuracy treats every mistake as equal, but reality does not.
Look Past One Number
The fix is not a magic metric yet, it is a mindset. Stop trusting a single number and start asking how the minority class actually did.
Set Up for Better Metrics
Soon you will meet precision, recall, and PR curves built for rare events. First, internalize why accuracy earned your distrust here.
Quick Check
Why can accuracy mislead on imbalanced data?
Recap
On imbalance, accuracy flatters lazy models that ignore the rare class. Beat the majority baseline and judge how the minority class truly did. 🎯
Często zadawane pytania
Czy lekcja „Dlaczego accuracy zawodzi przy niezbalansowanych danych” jest bezpłatna?
Tak — pełny tekst „Dlaczego accuracy zawodzi przy niezbalansowanych danych” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Data Science Academy, przejdź na CoddyKit PRO. Kurs Data Science Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Dlaczego accuracy zawodzi przy niezbalansowanych danych”?
Pułapka rzadkiej klasy Ćwiczysz Data Science Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć Data Science Academy?
Nie wymagamy żadnego doświadczenia. Data Science Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.
Ile czasu zajmuje lekcja „Dlaczego accuracy zawodzi przy niezbalansowanych danych”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji Data Science Academy?
Tak. Każda lekcja Data Science Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Dlaczego accuracy zawodzi przy niezbalansowanych danych
- Resampling: SMOTE i undersampling
- Wagi klas i progi
- Dobór metryk dla rzadkich zdarzeń