Eerst schalen, daarna PCA fitten
Waarom standaardisatie hier belangrijk is
Eerst schalen, daarna PCA fitten is een gratis Data Science Academy-les op CoddyKit. Dit is les 3 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Data Science Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Data Science Academy bevat in totaal 4 lessen.
PCA let op schaal
PCA zoekt de grootste variantie, maar variantie hangt af van de eenheden. Een kenmerk met grote getallen kan alleen door zijn schaal overheersen.
Een valkuil met eenheden
Stel je een salaris in euro's naast een leeftijd in jaren voor. Het salaris varieert in duizenden, dus PCA zou het onterecht veel belangrijker vinden.
Eerst standaardiseren
De oplossing is standaardisatie: schaal elk kenmerk om naar gemiddelde nul en eenheidsvariantie, zodat elk kenmerk op gelijke voet begint.
StandardScaler gebruiken
In scikit-learn centreert en schaalt StandardScaler je kolommen voordat PCA ze ooit te zien krijgt.
from sklearn.preprocessing import StandardScaler
Xs = StandardScaler().fit_transform(X)Daarna PCA fitten
Voer PCA uit op de geschaalde gegevens, nooit op de onbewerkte gegevens. Nu weerspiegelt elke component echte structuur en geen scheve eenheden.
from sklearn.decomposition import PCA
scores = PCA(n_components=2).fit_transform(Xs)Centreren is ook belangrijk
PCA gaat ervan uit dat de gegevens rond nul zijn gecentreerd. Standaardiseren regelt dit door het gemiddelde van elke kolom af te trekken, zodat de assen door het middelpunt van de gegevens lopen.
In een pijplijn combineren
Verpak de scaler en PCA in een Pipeline, zodat het schalen altijd eerst gebeurt en nooit lekt tussen je gegevenssplitsingen.
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), PCA(2))Alleen op de training fitten
Fit de scaler op trainingsgegevens en gebruik hem daarna opnieuw voor testgegevens. Als je op alles fit, lekken er gegevens en worden je scores kunstmatig hoger.
Wanneer je het kunt overslaan
Als elk kenmerk al dezelfde eenheid en hetzelfde bereik heeft, is schalen minder belangrijk. Weet je het niet zeker, standaardiseer dan toch; dat schaadt zelden.
Let op het verschil
Voer PCA uit met en zonder schaling op gegevens met gemengde eenheden. De verklaarde variantie en de belangrijkste componenten zien er opvallend verschillend uit.
Er bestaan robuuste opties
Bij sterke uitschieters kun je RobustScaler overwegen. Deze gebruikt medianen en kwartielen, zodat extreme punten minder invloed hebben op PCA.
from sklearn.preprocessing import RobustScalerSnelle controle
Welke stap komt bijna altijd direct vóór PCA?
Samenvatting
PCA is gevoelig voor schaal, dus standaardiseer eerst, fit alleen op trainingsgegevens en gebruik een pijplijn om de volgorde veilig te houden. 🎯
Leer Python met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 30
- Lessen
- 120
Veelgestelde vragen
Is de les “Eerst schalen, daarna PCA fitten” gratis?
Ja — de volledige tekst van “Eerst schalen, daarna PCA fitten” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus Data Science Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus Data Science Academy bevat in totaal 4 lessen.
Wat leer ik in “Eerst schalen, daarna PCA fitten”?
Waarom standaardisatie hier belangrijk is Je oefent met Data Science Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met Data Science Academy te beginnen?
Ervaring vooraf is niet nodig. Data Science Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 3 van 4.
Hoe lang duurt de les “Eerst schalen, daarna PCA fitten”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over Data Science Academy?
Ja. Elke les over Data Science Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- De vloek van te veel kenmerken
- Hoe PCA componenten vindt
- Eerst schalen, daarna PCA fitten
- Componenten kiezen met screeplots