Mettre à l’échelle avant d’ajuster PCA
Pourquoi la standardisation est importante ici
Mettre à l’échelle avant d’ajuster PCA est une leçon Data Science Academy gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Data Science Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Data Science Academy comprend 4 leçons au total.
La PCA tient compte de l’échelle
La PCA recherche la variance la plus élevée, mais la variance dépend des unités. Une caractéristique exprimée avec de grands nombres peut dominer simplement à cause de son échelle.
Le piège des unités
Imaginez un salaire en dollars à côté d’un âge en années. Le salaire varie de plusieurs milliers, si bien que la PCA le considérerait injustement comme beaucoup plus important.
Standardiser d’abord
La solution est la standardisation : remettre chaque caractéristique à une moyenne nulle et une variance unitaire afin qu’elles partent toutes sur un pied d’égalité.
Utiliser StandardScaler
Dans scikit-learn, StandardScaler centre et met vos colonnes à l’échelle avant même que la PCA ne les examine.
from sklearn.preprocessing import StandardScaler
Xs = StandardScaler().fit_transform(X)Puis ajuster la PCA
Exécutez la PCA sur les données mises à l’échelle, jamais sur les données brutes. Chaque composante reflète alors une structure réelle, et non des unités déséquilibrées.
from sklearn.decomposition import PCA
scores = PCA(n_components=2).fit_transform(Xs)Le centrage compte aussi
La PCA suppose que les données sont centrées sur zéro. La standardisation s’en charge en soustrayant la moyenne de chaque colonne, afin que les axes passent par le centre des données.
Enchaîner dans une chaîne de traitement
Regroupez le redimensionnement et la PCA dans une chaîne de traitement afin que le redimensionnement ait toujours lieu en premier et qu’aucune fuite ne se produise entre vos partitions de données.
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), PCA(2))Ajuster uniquement sur l’entraînement
Ajustez le redimensionnement sur les données d’entraînement, puis réutilisez-le sur les données de test. L’ajuster sur l’ensemble des données introduit une fuite d’information et gonfle vos scores.
Quand vous pouvez vous en passer
Si toutes les caractéristiques utilisent déjà la même unité et la même plage de valeurs, le redimensionnement est moins important. En cas de doute, standardisez tout de même : cela nuit rarement aux résultats.
Observer la différence
Exécutez la PCA avec et sans redimensionnement sur des données utilisant des unités différentes. La variance expliquée et les premières composantes seront étonnamment différentes.
Des options robustes existent
En présence de fortes valeurs aberrantes, envisagez RobustScaler, qui utilise les médianes et les quartiles afin que les points extrêmes influencent moins la PCA.
from sklearn.preprocessing import RobustScalerVérification rapide
Une étape précède presque toujours la PCA.
Récapitulatif
La PCA est sensible à l’échelle : standardisez donc d’abord, ajustez uniquement sur les données d’entraînement et utilisez une chaîne de traitement pour conserver un ordre sûr. 🎯
Apprends Python avec un tuteur IA — gratuit
Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.
- Cours
- 30
- Leçons
- 120
Questions Fréquemment Posées
La leçon « Mettre à l’échelle avant d’ajuster PCA » est-elle gratuite ?
Oui — le texte complet de « Mettre à l’échelle avant d’ajuster PCA » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Data Science Academy, passe à CoddyKit PRO. Le cours Data Science Academy comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Mettre à l’échelle avant d’ajuster PCA » ?
Pourquoi la standardisation est importante ici Tu pratiques Data Science Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer Data Science Academy ?
Aucune expérience préalable n'est requise. Data Science Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.
Combien de temps prend la leçon « Mettre à l’échelle avant d’ajuster PCA » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon Data Science Academy ?
Oui. Chaque leçon Data Science Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Le fléau d’un trop grand nombre de variables
- Comment PCA trouve ses composantes
- Mettre à l’échelle avant d’ajuster PCA
- Choisir les composantes avec un graphique des éboulis