0Pricing
Data Science Academy · Lezione

Scalare prima, adattare PCA dopo

Perché la standardizzazione è importante in questo caso.

Scalare prima, adattare PCA dopo è una lezione Data Science Academy gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Data Science Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Data Science Academy include 4 lezioni in totale.

PCA tiene conto della scala

PCA cerca la varianza maggiore, ma la varianza dipende dalle unità. Una feature espressa con numeri grandi può dominare solo per via della sua scala.

Una trappola delle unità

Immagini lo stipendio in euro accanto all'età in anni. Lo stipendio varia di migliaia, quindi PCA lo considererebbe ingiustamente molto più importante.

Standardizzare prima

La soluzione è la standardizzazione: ridimensionare ogni feature a media zero e varianza unitaria, così partono tutte dallo stesso livello.

Usare StandardScaler

In scikit-learn, StandardScaler centra e ridimensiona le colonne prima che PCA le analizzi.

from sklearn.preprocessing import StandardScaler
Xs = StandardScaler().fit_transform(X)

Poi eseguire il fit di PCA

Esegua PCA sui dati ridimensionati, mai su quelli grezzi. Ora ogni componente riflette la struttura reale, non unità sbilanciate.

from sklearn.decomposition import PCA
scores = PCA(n_components=2).fit_transform(Xs)

Anche il centraggio è importante

PCA presuppone che i dati siano centrati intorno a zero. La standardizzazione lo gestisce sottraendo la media di ogni colonna, così gli assi passano per il centro dei dati.

Inserirla in una pipeline

Racchiuda lo scaler e PCA in una Pipeline, così il ridimensionamento avviene sempre per primo e non si verifica leakage tra le suddivisioni dei dati.

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), PCA(2))

Eseguire il fit solo sui dati di addestramento

Esegua il fit dello scaler sui dati di addestramento, poi lo riutilizzi sui dati di test. Eseguire il fit su tutto introduce leakage e gonfia i punteggi.

Quando può evitarlo

Se ogni feature usa già la stessa unità e lo stesso intervallo, il ridimensionamento è meno importante. In caso di dubbio, standardizzi comunque: raramente è dannoso.

Osservare la differenza

Esegua PCA con e senza ridimensionamento su dati con unità miste. La varianza spiegata e le componenti principali appariranno molto diverse.

Esistono opzioni robuste

In presenza di outlier marcati, consideri RobustScaler, che usa mediane e quartili, così i punti estremi influenzano meno PCA.

from sklearn.preprocessing import RobustScaler

Controllo rapido

C'è un passaggio che quasi sempre viene subito prima di PCA.

Riepilogo

PCA è sensibile alla scala, quindi standardizzi prima, esegua il fit solo sui dati di addestramento e usi una pipeline per mantenere l'ordine corretto. 🎯

Domande Frequenti

La lezione «Scalare prima, adattare PCA dopo» è gratuita?

Sì — il testo completo di «Scalare prima, adattare PCA dopo» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Data Science Academy, passa a CoddyKit PRO. Il corso Data Science Academy include 4 lezioni in totale.

Cosa imparerò in «Scalare prima, adattare PCA dopo»?

Perché la standardizzazione è importante in questo caso. Eserciti Data Science Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare Data Science Academy?

Non è richiesta alcuna esperienza precedente. Data Science Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.

Quanto tempo richiede la lezione «Scalare prima, adattare PCA dopo»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione Data Science Academy?

Sì. Ogni lezione Data Science Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. La maledizione delle troppe feature
  2. Come PCA trova le componenti
  3. Scalare prima, adattare PCA dopo
  4. Scegliere le componenti con gli scree plot
← Torna a Data Science Academy