0Pricing
Data Science Academy · Lezione

Scalare e normalizzare i numeri

Portare le feature su una scala equa.

Scalare e normalizzare i numeri è una lezione Data Science Academy gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Data Science Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Data Science Academy include 4 lezioni in totale.

Perché scalare i numeri

L'età va da 0 a 90, mentre il reddito può arrivare a milioni. Senza scalatura, i numeri più grandi dominano e finiscono per mettere in ombra quelli più piccoli. ⚖️

I modelli basati sulla distanza sono sensibili

I modelli che misurano la distanza, come k-NN e k-means, sono molto sensibili alla scala. Le variabili non scalate danno tutto il potere alla colonna con i valori più grandi.

Standardizzazione

La standardizzazione ridimensiona una colonna portandone la media a 0 e la deviazione standard a 1. I valori indicano quante deviazioni standard li separano dalla media.

StandardScaler

StandardScaler applica automaticamente la standardizzazione. Lo adatti ai dati e poi trasformi qualsiasi colonna in punteggi z.

from sklearn.preprocessing import StandardScaler
z = StandardScaler().fit_transform(df[['age']])

Normalizzazione

La normalizzazione comprime i valori in un intervallo fisso, solitamente da 0 a 1. Il valore minimo viene mappato a 0 e quello massimo a 1.

MinMaxScaler

Usi MinMaxScaler per ridimensionare i valori nell'intervallo da 0 a 1. Mantiene la forma dei dati, limitandone al contempo l'intervallo.

from sklearn.preprocessing import MinMaxScaler
m = MinMaxScaler().fit_transform(df[['age']])

Standardizzare o normalizzare

Usi la standardizzazione quando i dati hanno una forma approssimativamente a campana o contengono valori anomali. Scelga la normalizzazione quando serve un limite rigoroso da 0 a 1.

I valori anomali danneggiano MinMax

Un singolo valore enorme può schiacciare tutti gli altri vicino allo zero con MinMax. Quando i valori anomali dominano, RobustScaler li gestisce meglio.

from sklearn.preprocessing import RobustScaler
r = RobustScaler().fit_transform(df[['income']])

Adattare solo ai dati di addestramento

Adatti lo scaler solo ai dati di addestramento, poi trasformi il set di test. Adattarlo a tutti i dati introduce informazioni di test nel modello.

scaler.fit(X_train)
X_test_scaled = scaler.transform(X_test)

Scalare all'interno di una pipeline

Raggruppi lo scaler e il modello in una Pipeline. Durante la convalida incrociata, l'adattamento avviene solo sulla suddivisione di addestramento, impedendo così la fuga di dati.

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), model)

Gli alberi non ne hanno bisogno

I modelli basati su alberi, come le foreste casuali, dividono i dati usando soglie, quindi la scalatura cambia raramente i risultati. La riservi ai metodi basati sulla distanza e ai metodi lineari.

Verifica rapida

Deve ridimensionare ogni variabile in un intervallo rigoroso da 0 a 1. Quale scaler è adatto?

Riepilogo: scalatura

Ha messo le variabili sullo stesso piano: StandardScaler per i punteggi z, MinMaxScaler per l'intervallo da 0 a 1 e RobustScaler per i valori anomali. Adatti sempre solo ai dati di addestramento. 🎉

Domande Frequenti

La lezione «Scalare e normalizzare i numeri» è gratuita?

Sì — il testo completo di «Scalare e normalizzare i numeri» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Data Science Academy, passa a CoddyKit PRO. Il corso Data Science Academy include 4 lezioni in totale.

Cosa imparerò in «Scalare e normalizzare i numeri»?

Portare le feature su una scala equa. Eserciti Data Science Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare Data Science Academy?

Non è richiesta alcuna esperienza precedente. Data Science Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.

Quanto tempo richiede la lezione «Scalare e normalizzare i numeri»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione Data Science Academy?

Sì. Ogni lezione Data Science Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Raggruppare i numeri in categorie
  2. Codificare le colonne categoriche
  3. Scalare e normalizzare i numeri
  4. Creare feature da date e testo
← Torna a Data Science Academy