Lær AI med Python · Lektion

Feature-skalering: normalisering og standardisering

MinMaxScaler, StandardScaler, RobustScaler — hvornår de hver især bruges, og hvorfor det er vigtigt.

Lektion 3 af 413 trin

Feature-skalering: normalisering og standardisering er en gratis Lær AI med Python-lektion på CoddyKit. Dette er lektion 3 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Lær AI med Python, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Hvorfor skalere egenskaber

Mange algoritmer er følsomme over for egenskabernes STØRRELSESORDEN. En egenskab, der går fra 0 til 1.000.000, vil dominere en egenskab, der går fra 0 til 1, i afstands- eller gradientbaserede modeller. Skalering bringer egenskaberne ind på sammenlignelige intervaller.

Hvem har brug for skalering

Skalering er vigtig for KNN, SVM, k-means, PCA og modeller med gradientbaseret optimering som lineær/logistisk regression og neurale netværk. Træbaserede modeller (random forests, gradient boosting) er uafhængige af skala og har ikke brug for det.

Normalisering: MinMaxScaler

Min-max-normalisering skalerer hver egenskab til et fast interval, normalt fra 0 til 1, med (x - min) / (max - min). Den bevarer fordelingens form.

from sklearn.preprocessing import MinMaxScaler
import numpy as np
X = np.array([[10.0], [20.0], [30.0], [40.0]])
scaler = MinMaxScaler()
print(scaler.fit_transform(X).ravel())   # [0. 0.333 0.667 1.]

Standardisering: StandardScaler

Standardisering giver hver egenskab et gennemsnit på nul og en varians på én med (x - mean) / std. Resultatet er en z-score; værdierne centreres, men begrænses ikke til et bestemt interval.

from sklearn.preprocessing import StandardScaler
scaler = StandardScaler()
Xs = scaler.fit_transform(X)
print(Xs.ravel())
print(Xs.mean(), Xs.std())   # ~0 and ~1

MinMax kontra Standard

Brug MinMax, når du har brug for et begrænset interval (f.eks. billedpixelværdier eller inddata til neurale netværk). Brug Standard, når algoritmen antager data, der omtrent er centreret omkring nul (PCA, SVM, lineære modeller). MinMax er mere følsom over for afvigende værdier.

RobustScaler til afvigende værdier

RobustScaler centrerer omkring MEDIANEN og skalerer med IQR. Fordi begge dele modstår påvirkningen fra afvigende værdier, er den det rigtige valg, når ekstreme værdier ellers ville forvrænge de andre skalere.

from sklearn.preprocessing import RobustScaler
Xo = np.array([[1.0], [2.0], [3.0], [4.0], [100.0]])
print(RobustScaler().fit_transform(Xo).ravel())

fit kontra transform

Skalere LÆRER parametre i fit (minimum/maksimum eller gennemsnit/standardafvigelse) og ANVENDER dem i transform. fit_transform gør begge dele i ét kald.

scaler = StandardScaler()
scaler.fit(X)          # learns mean and std
Xs = scaler.transform(X)   # applies them

Den gyldne regel: Brug kun fit på træningsdata

Brug altid fit på træningssættet, og brug derefter kun transform på testsættet med de indlærte parametre. Hvis du bruger fit på testdata, lækker oplysninger om dem ind i modellen.

scaler = StandardScaler()
X_train_scaled = scaler.fit_transform(X_train)
X_test_scaled = scaler.transform(X_test)   # transform only!

Hvorfor ikke bruge fit på testdata

Hvis du skalerer med statistikker, der omfatter testsættet, får evalueringen oplysninger, den ikke burde have. Det er datalækage. Det giver optimistiske og upålidelige estimater af ydeevnen.

Omvendt transformering

Skalere kan vende operationen med inverse_transform, hvilket er nyttigt til at omdanne skalerede forudsigelser tilbage til de oprindelige enheder, når du rapporterer fejl.

original = scaler.inverse_transform(X_train_scaled)
# recovers the pre-scaled values

Skalering af målet

Ved klassifikation skalerer du normalt EGENSKABERNE, ikke målet. Ved regression kan du også skalere målet, men husk så at bruge inverse-transformering på forudsigelserne, før du rapporterer fejl.

Hurtigt tjek

Test din viden om skalering.

Opsummering

Værktøjer til skalering:

  • Skalering er vigtig for afstands- og gradientbaserede modeller; træmodeller ignorerer den
  • MinMaxScaler -> begrænset til 0..1; StandardScaler -> gennemsnit på nul, varians på én
  • RobustScaler bruger median og IQR og er robust over for afvigende værdier
  • Brug altid fit_transform på træningsdata og kun transform på testdata (undgå datalækage)
Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
53
Lektioner
225

Ofte stillede spørgsmål

Er lektionen “Feature-skalering: normalisering og standardisering” gratis?

Ja — alle 3 lektioner i læringssporet Lær AI med Python, inklusive “Feature-skalering: normalisering og standardisering”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Feature-skalering: normalisering og standardisering”?

MinMaxScaler, StandardScaler, RobustScaler — hvornår de hver især bruges, og hvorfor det er vigtigt. Du øver dig i Lær AI med Python med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Lær AI med Python?

Der kræves ingen tidligere erfaring. Lær AI med Python på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 3 af 4.

Hvor lang tid tager lektionen “Feature-skalering: normalisering og standardisering”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Lær AI med Python-lektion?

Ja. Alle Lær AI med Python-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Detektion og fjernelse af outliers
  2. Kodning af kategoriske variabler
  3. Feature-skalering: normalisering og standardisering
  4. Opbygning af preprocessing-pipelines
← Tilbage til Lær AI med Python