Wybieranie składowych za pomocą wykresów osypiska
Zachowywanie wystarczającej wyjaśnionej wariancji
Wybieranie składowych za pomocą wykresów osypiska to bezpłatna lekcja Data Science Academy na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Data Science Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Data Science Academy zawiera 4 lekcji w sumie.
Części tej lekcji nie zostały jeszcze przetłumaczone i są wyświetlane po angielsku.
How Many to Keep?
PCA can hand you dozens of components, but you only want the useful few. The real skill is choosing how many to keep.
Meet the Scree Plot
A scree plot charts each component against the variance it explains, so you can see importance drop off at a glance.
Look for the Elbow
Variance falls fast then levels into a flat tail. The bend, called the elbow, marks where extra components stop paying off.
Plot the Ratios
Fit PCA with all components, then plot explained_variance_ratio_ to draw the curve and spot that elbow.
import matplotlib.pyplot as plt
plt.plot(pca.explained_variance_ratio_)Cumulative Variance
Add the ratios up as you go to get cumulative variance, showing the total information kept by the first k components.
import numpy as np
cum = np.cumsum(pca.explained_variance_ratio_)Pick a Threshold
A common rule is to keep enough components to reach a target, like 95 percent of total variance retained.
Let scikit-learn Choose
Pass a fraction as n_components and scikit-learn keeps just enough components to hit that explained-variance target.
from sklearn.decomposition import PCA
pca = PCA(n_components=0.95).fit(X)The Kaiser Rule
Another guide, the Kaiser rule, keeps components whose eigenvalue exceeds one, meaning they explain more than a single feature would.
Balance the Trade-Off
Fewer components mean simpler, faster models but more lost detail. Choosing k is always a trade-off between size and fidelity.
Validate Downstream
The best k is the one that helps your real task. Try a few values and compare model scores with cross-validation.
Beware Tiny Components
Components past the elbow often capture mostly noise. Keeping them rarely helps and can quietly hurt your model.
Quick Check
The scree plot points you to one telltale spot.
Recap
Use a scree plot, elbow, or a cumulative-variance threshold to keep just enough components, then validate k downstream. 🎯
Często zadawane pytania
Czy lekcja „Wybieranie składowych za pomocą wykresów osypiska” jest bezpłatna?
Tak — pełny tekst „Wybieranie składowych za pomocą wykresów osypiska” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Data Science Academy, przejdź na CoddyKit PRO. Kurs Data Science Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Wybieranie składowych za pomocą wykresów osypiska”?
Zachowywanie wystarczającej wyjaśnionej wariancji Ćwiczysz Data Science Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć Data Science Academy?
Nie wymagamy żadnego doświadczenia. Data Science Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.
Ile czasu zajmuje lekcja „Wybieranie składowych za pomocą wykresów osypiska”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji Data Science Academy?
Tak. Każda lekcja Data Science Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Przekleństwo zbyt wielu cech
- Jak PCA znajduje składowe
- Najpierw skalowanie, potem dopasowanie PCA
- Wybieranie składowych za pomocą wykresów osypiska