Data Science Academy · Lekcja

Najpierw skalowanie, potem dopasowanie PCA

Dlaczego standaryzacja ma tu znaczenie

Lekcja 3 z 413 kroki

Najpierw skalowanie, potem dopasowanie PCA to bezpłatna lekcja Data Science Academy na CoddyKit. To lekcja 3 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Data Science Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Data Science Academy zawiera 4 lekcji w sumie.

PCA uwzględnia skalę

PCA szuka największej wariancji, ale wariancja zależy od jednostek. Cecha wyrażona dużymi liczbami może zdominować pozostałe tylko ze względu na swoją skalę.

Pułapka jednostek

Wyobraźmy sobie wynagrodzenie w złotych obok wieku w latach. Wynagrodzenie zmienia się o tysiące, więc PCA niesprawiedliwie uzna je za znacznie ważniejsze.

Najpierw standaryzacja

Rozwiązaniem jest standaryzacja: przeskalowanie każdej cechy tak, aby miała średnią równą zero i wariancję równą jeden, dzięki czemu wszystkie zaczynają z równej pozycji.

Użycie StandardScaler

W scikit-learn StandardScaler centruje i skaluje kolumny, zanim PCA w ogóle je zobaczy.

from sklearn.preprocessing import StandardScaler
Xs = StandardScaler().fit_transform(X)

Następnie dopasowanie PCA

Uruchom PCA na przeskalowanych danych, nigdy na danych surowych. Dzięki temu każda składowa odzwierciedla rzeczywistą strukturę, a nie nierówne jednostki.

from sklearn.decomposition import PCA
scores = PCA(n_components=2).fit_transform(Xs)

Centrowanie też ma znaczenie

PCA zakłada, że dane są wycentrowane wokół zera. Standaryzacja zapewnia to przez odjęcie średniej każdej kolumny, dzięki czemu osie przechodzą przez środek danych.

Połączenie w potoku

Połącz skaler i PCA w obiekcie Pipeline, aby skalowanie zawsze odbywało się jako pierwsze i nigdy nie powodowało wycieku danych między ich podziałami.

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), PCA(2))

Dopasowanie tylko do danych treningowych

Dopasuj skaler do danych treningowych, a następnie użyj go ponownie dla danych testowych. Dopasowanie do całości powoduje wyciek informacji i zawyża wyniki.

Kiedy można pominąć skalowanie

Jeśli każda cecha ma już tę samą jednostkę i zakres, skalowanie ma mniejsze znaczenie. W razie wątpliwości należy mimo wszystko standaryzować dane — rzadko ma to negatywne skutki.

Obserwowanie różnicy

Uruchom PCA ze skalowaniem i bez niego dla danych zawierających różne jednostki. Wyjaśniona wariancja i najważniejsze składowe będą wyglądać zaskakująco różnie.

Istnieją odporne opcje

Przy silnych wartościach odstających warto rozważyć RobustScaler, który korzysta z median i kwartylów, dzięki czemu skrajne punkty mają mniejszy wpływ na PCA.

from sklearn.preprocessing import RobustScaler

Szybkie sprawdzenie

Jeden krok prawie zawsze znajduje się bezpośrednio przed PCA.

Podsumowanie

PCA jest wrażliwe na skalę, dlatego najpierw należy standaryzować dane, dopasowywać model wyłącznie do danych treningowych, a kolejność kroków zabezpieczyć potokiem. 🎯

Bezpłatny start

Ucz się Python dzięki korepetycjom AI — za darmo

Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.

Kursy
30
Lekcje
120

Często zadawane pytania

Czy lekcja „Najpierw skalowanie, potem dopasowanie PCA” jest bezpłatna?

Tak — pełny tekst „Najpierw skalowanie, potem dopasowanie PCA” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Data Science Academy, przejdź na CoddyKit PRO. Kurs Data Science Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Najpierw skalowanie, potem dopasowanie PCA”?

Dlaczego standaryzacja ma tu znaczenie Ćwiczysz Data Science Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć Data Science Academy?

Nie wymagamy żadnego doświadczenia. Data Science Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 3 z 4.

Ile czasu zajmuje lekcja „Najpierw skalowanie, potem dopasowanie PCA”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji Data Science Academy?

Tak. Każda lekcja Data Science Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Przekleństwo zbyt wielu cech
  2. Jak PCA znajduje składowe
  3. Najpierw skalowanie, potem dopasowanie PCA
  4. Wybieranie składowych za pomocą wykresów osypiska
← Powrót do Data Science Academy