0Pricing
NLP Academy · Lekcja

Dlaczego rzadkie klasy są pomijane

Koszt niezrównoważonych etykiet

Dlaczego rzadkie klasy są pomijane to bezpłatna lekcja NLP Academy na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej NLP Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs NLP Academy zawiera 4 lekcji w sumie.

Niezrównoważenie — definicja

Gdy liczba przykładów jednej etykiety znacznie przewyższa liczbę przykładów innej, dane są niezrównoważone. Wyobraź sobie 9500 zwykłych wiadomości e-mail i 500 wiadomości spamowych.

Droga na skróty

Model chce szybko osiągnąć wysoką dokładność. Najprostsze rozwiązanie to zawsze przewidywać klasę większościową i po cichu ignorować rzadką. 😬

95% — i co z tego?

Przy 5% spamu model, który oznacza wszystko jako ham, osiąga 95% dokładności, a mimo to nie wykrywa żadnego spamu. Ta liczba niczego nie pokazuje.

Dlaczego funkcja straty na to pozwala

Standardowy trening minimalizuje całkowity błąd. Ponieważ błędów dotyczących rzadkiej klasy jest niewiele, funkcja straty prawie się nie zmienia, gdy model je ignoruje.

Większość a mniejszość

Dużą grupę nazywamy klasą większościową, a małą — klasą mniejszościową. W NLP najczęściej najbardziej interesuje nas mniejszość.

Zobacz nierównowagę

Zanim zaczniesz modelowanie, policz etykiety. Jedna linia kodu pokazuje, jak bardzo nierówny jest rzeczywisty rozkład klas.

from collections import Counter
print(Counter(labels))

Rzeczywisty koszt

Przeoczenie wiadomości będącej spamem, oszustwem lub nadużyciem może być kosztowne. W NLP rzadka klasa to zwykle ta, którą model ma wykrywać.

Granica decyzyjna się przesuwa

Przy niewielkiej liczbie przykładów mniejszości granica decyzyjna przesuwa się w stronę liczniejszej grupy, niemal całkowicie pochłaniając obszar rzadkiej klasy.

Dokładność to zła perspektywa

W przypadku nierównych danych dokładność ukrywa porażkę. Potrzebujesz metryk, które uwidaczniają rzadką klasę, takich jak czułość dla mniejszości.

Sprawdź współczynnik nierównowagi

Szybkie obliczenie współczynnika nierównowagi pokaże jej skalę. Stosunek dziesięć do jednego jest umiarkowany, ale tysiąc do jednego wymaga poważnej uwagi.

ratio = counts.max() / counts.min()
print(round(ratio, 1))

Najpierw zdiagnozuj, potem napraw

Określenie problemu to połowa sukcesu. Gdy zauważysz nierównowagę, możesz wybrać ponowne próbkowanie lub wagi, aby sobie z nią poradzić.

Szybkie sprawdzenie

Sprawdźmy podstawową ideę stojącą za niezrównoważeniem.

Podsumowanie

Niezrównoważone dane pozwalają modelom ignorować rzadką klasę i jednocześnie uzyskiwać wysoką dokładność. Najpierw znajdź nierównowagę, a następnie ją napraw. ✅

Często zadawane pytania

Czy lekcja „Dlaczego rzadkie klasy są pomijane” jest bezpłatna?

Tak — pełny tekst „Dlaczego rzadkie klasy są pomijane” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu NLP Academy, przejdź na CoddyKit PRO. Kurs NLP Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Dlaczego rzadkie klasy są pomijane”?

Koszt niezrównoważonych etykiet Ćwiczysz NLP Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć NLP Academy?

Nie wymagamy żadnego doświadczenia. NLP Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.

Ile czasu zajmuje lekcja „Dlaczego rzadkie klasy są pomijane”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji NLP Academy?

Tak. Każda lekcja NLP Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Dlaczego rzadkie klasy są pomijane
  2. Resampling i wagi klas
  3. Wybór progu i metryki
  4. Kompletny potok dla niezrównoważonych danych
← Powrót do NLP Academy