Najpierw skalowanie, potem dopasowanie PCA
Dlaczego standaryzacja ma tu znaczenie
Najpierw skalowanie, potem dopasowanie PCA to bezpłatna lekcja Data Science Academy na CoddyKit. To lekcja 3 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Data Science Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Data Science Academy zawiera 4 lekcji w sumie.
PCA uwzględnia skalę
PCA szuka największej wariancji, ale wariancja zależy od jednostek. Cecha wyrażona dużymi liczbami może zdominować pozostałe tylko ze względu na swoją skalę.
Pułapka jednostek
Wyobraźmy sobie wynagrodzenie w złotych obok wieku w latach. Wynagrodzenie zmienia się o tysiące, więc PCA niesprawiedliwie uzna je za znacznie ważniejsze.
Najpierw standaryzacja
Rozwiązaniem jest standaryzacja: przeskalowanie każdej cechy tak, aby miała średnią równą zero i wariancję równą jeden, dzięki czemu wszystkie zaczynają z równej pozycji.
Użycie StandardScaler
W scikit-learn StandardScaler centruje i skaluje kolumny, zanim PCA w ogóle je zobaczy.
from sklearn.preprocessing import StandardScaler
Xs = StandardScaler().fit_transform(X)Następnie dopasowanie PCA
Uruchom PCA na przeskalowanych danych, nigdy na danych surowych. Dzięki temu każda składowa odzwierciedla rzeczywistą strukturę, a nie nierówne jednostki.
from sklearn.decomposition import PCA
scores = PCA(n_components=2).fit_transform(Xs)Centrowanie też ma znaczenie
PCA zakłada, że dane są wycentrowane wokół zera. Standaryzacja zapewnia to przez odjęcie średniej każdej kolumny, dzięki czemu osie przechodzą przez środek danych.
Połączenie w potoku
Połącz skaler i PCA w obiekcie Pipeline, aby skalowanie zawsze odbywało się jako pierwsze i nigdy nie powodowało wycieku danych między ich podziałami.
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), PCA(2))Dopasowanie tylko do danych treningowych
Dopasuj skaler do danych treningowych, a następnie użyj go ponownie dla danych testowych. Dopasowanie do całości powoduje wyciek informacji i zawyża wyniki.
Kiedy można pominąć skalowanie
Jeśli każda cecha ma już tę samą jednostkę i zakres, skalowanie ma mniejsze znaczenie. W razie wątpliwości należy mimo wszystko standaryzować dane — rzadko ma to negatywne skutki.
Obserwowanie różnicy
Uruchom PCA ze skalowaniem i bez niego dla danych zawierających różne jednostki. Wyjaśniona wariancja i najważniejsze składowe będą wyglądać zaskakująco różnie.
Istnieją odporne opcje
Przy silnych wartościach odstających warto rozważyć RobustScaler, który korzysta z median i kwartylów, dzięki czemu skrajne punkty mają mniejszy wpływ na PCA.
from sklearn.preprocessing import RobustScalerSzybkie sprawdzenie
Jeden krok prawie zawsze znajduje się bezpośrednio przed PCA.
Podsumowanie
PCA jest wrażliwe na skalę, dlatego najpierw należy standaryzować dane, dopasowywać model wyłącznie do danych treningowych, a kolejność kroków zabezpieczyć potokiem. 🎯
Ucz się Python dzięki korepetycjom AI — za darmo
Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.
- Kursy
- 30
- Lekcje
- 120
Często zadawane pytania
Czy lekcja „Najpierw skalowanie, potem dopasowanie PCA” jest bezpłatna?
Tak — pełny tekst „Najpierw skalowanie, potem dopasowanie PCA” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Data Science Academy, przejdź na CoddyKit PRO. Kurs Data Science Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Najpierw skalowanie, potem dopasowanie PCA”?
Dlaczego standaryzacja ma tu znaczenie Ćwiczysz Data Science Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć Data Science Academy?
Nie wymagamy żadnego doświadczenia. Data Science Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 3 z 4.
Ile czasu zajmuje lekcja „Najpierw skalowanie, potem dopasowanie PCA”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji Data Science Academy?
Tak. Każda lekcja Data Science Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Przekleństwo zbyt wielu cech
- Jak PCA znajduje składowe
- Najpierw skalowanie, potem dopasowanie PCA
- Wybieranie składowych za pomocą wykresów osypiska