Dlaczego rzadkie klasy są pomijane
Koszt niezrównoważonych etykiet
Dlaczego rzadkie klasy są pomijane to bezpłatna lekcja NLP Academy na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej NLP Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs NLP Academy zawiera 4 lekcji w sumie.
Niezrównoważenie — definicja
Gdy liczba przykładów jednej etykiety znacznie przewyższa liczbę przykładów innej, dane są niezrównoważone. Wyobraź sobie 9500 zwykłych wiadomości e-mail i 500 wiadomości spamowych.
Droga na skróty
Model chce szybko osiągnąć wysoką dokładność. Najprostsze rozwiązanie to zawsze przewidywać klasę większościową i po cichu ignorować rzadką. 😬
95% — i co z tego?
Przy 5% spamu model, który oznacza wszystko jako ham, osiąga 95% dokładności, a mimo to nie wykrywa żadnego spamu. Ta liczba niczego nie pokazuje.
Dlaczego funkcja straty na to pozwala
Standardowy trening minimalizuje całkowity błąd. Ponieważ błędów dotyczących rzadkiej klasy jest niewiele, funkcja straty prawie się nie zmienia, gdy model je ignoruje.
Większość a mniejszość
Dużą grupę nazywamy klasą większościową, a małą — klasą mniejszościową. W NLP najczęściej najbardziej interesuje nas mniejszość.
Zobacz nierównowagę
Zanim zaczniesz modelowanie, policz etykiety. Jedna linia kodu pokazuje, jak bardzo nierówny jest rzeczywisty rozkład klas.
from collections import Counter
print(Counter(labels))Rzeczywisty koszt
Przeoczenie wiadomości będącej spamem, oszustwem lub nadużyciem może być kosztowne. W NLP rzadka klasa to zwykle ta, którą model ma wykrywać.
Granica decyzyjna się przesuwa
Przy niewielkiej liczbie przykładów mniejszości granica decyzyjna przesuwa się w stronę liczniejszej grupy, niemal całkowicie pochłaniając obszar rzadkiej klasy.
Dokładność to zła perspektywa
W przypadku nierównych danych dokładność ukrywa porażkę. Potrzebujesz metryk, które uwidaczniają rzadką klasę, takich jak czułość dla mniejszości.
Sprawdź współczynnik nierównowagi
Szybkie obliczenie współczynnika nierównowagi pokaże jej skalę. Stosunek dziesięć do jednego jest umiarkowany, ale tysiąc do jednego wymaga poważnej uwagi.
ratio = counts.max() / counts.min()
print(round(ratio, 1))Najpierw zdiagnozuj, potem napraw
Określenie problemu to połowa sukcesu. Gdy zauważysz nierównowagę, możesz wybrać ponowne próbkowanie lub wagi, aby sobie z nią poradzić.
Szybkie sprawdzenie
Sprawdźmy podstawową ideę stojącą za niezrównoważeniem.
Podsumowanie
Niezrównoważone dane pozwalają modelom ignorować rzadką klasę i jednocześnie uzyskiwać wysoką dokładność. Najpierw znajdź nierównowagę, a następnie ją napraw. ✅
Często zadawane pytania
Czy lekcja „Dlaczego rzadkie klasy są pomijane” jest bezpłatna?
Tak — pełny tekst „Dlaczego rzadkie klasy są pomijane” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu NLP Academy, przejdź na CoddyKit PRO. Kurs NLP Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Dlaczego rzadkie klasy są pomijane”?
Koszt niezrównoważonych etykiet Ćwiczysz NLP Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć NLP Academy?
Nie wymagamy żadnego doświadczenia. NLP Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.
Ile czasu zajmuje lekcja „Dlaczego rzadkie klasy są pomijane”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji NLP Academy?
Tak. Każda lekcja NLP Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Dlaczego rzadkie klasy są pomijane
- Resampling i wagi klas
- Wybór progu i metryki
- Kompletny potok dla niezrównoważonych danych