Skala och normalisera tal
Ge egenskaperna jämförbara skalor
Skala och normalisera tal är en gratis lektion i Data Science Academy på CoddyKit. Detta är lektion 3 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för Data Science Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i Data Science Academy innehåller totalt 4 lektioner.
Varför skala tal
Ålder sträcker sig från 0 till 90, medan inkomst kan uppgå till miljontals kronor. Utan skalning dominerar de större talen och dränker i tysthet de mindre. ⚖️
Avståndsbaserade modeller bryr sig
Modeller som mäter avstånd, till exempel k-NN och k-means, är mycket känsliga för skalan. Oskalade egenskaper ger all makt åt den största kolumnen.
Standardisering
Standardisering skalar om en kolumn så att medelvärdet blir 0 och standardavvikelsen 1. Värdena visar då hur många standardavvikelser de ligger från medelvärdet.
StandardScaler
StandardScaler utför standardiseringen åt Er. Anpassa den till era data och transformera sedan valfri kolumn till z-poäng.
from sklearn.preprocessing import StandardScaler
z = StandardScaler().fit_transform(df[['age']])Normalisering
Normalisering pressar ihop värden till ett fast intervall, vanligtvis 0 till 1. Det minsta värdet mappas till 0 och det största till 1.
MinMaxScaler
Använd MinMaxScaler för att skala om värden till 0–1. Den bevarar formen på era data samtidigt som intervallet begränsas.
from sklearn.preprocessing import MinMaxScaler
m = MinMaxScaler().fit_transform(df[['age']])Standardisera eller normalisera
Använd standardisering när data ungefär följer en klockformad fördelning eller innehåller extremvärden. Välj normalisering när Ni behöver en strikt gräns från 0 till 1.
Extremvärden skadar MinMax
Ett enda mycket stort värde kan pressa ihop alla andra värden nära noll med MinMax. När extremvärden dominerar står RobustScaler emot dem bättre.
from sklearn.preprocessing import RobustScaler
r = RobustScaler().fit_transform(df[['income']])Anpassa endast till träningsdata
Anpassa skalaren enbart till träningsdata och transformera sedan testmängden. Om Ni anpassar den till allt läcker testinformation in i modellen.
scaler.fit(X_train)
X_test_scaled = scaler.transform(X_test)Skala inuti en pipeline
Samla skalaren och modellen i en Pipeline. Då anpassas den endast till träningsdelen under korsvalidering, vilket automatiskt förhindrar läckage.
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), model)Träd behöver det inte
Trädbaserade modeller, som random forests, delar upp data med tröskelvärden, så skalning ändrar sällan resultaten. Spara skalning till avståndsbaserade och linjära metoder.
Snabb kontroll
Ni behöver skala om varje egenskap till ett strikt intervall från 0 till 1. Vilken skala passar?
Repetition: skalning
Ni gav egenskaperna likvärdiga förutsättningar: StandardScaler för z-poäng, MinMaxScaler för 0 till 1 och RobustScaler för extremvärden. Anpassa alltid endast till träningsdata. 🎉
Lär dig Python med en AI-lärare – gratis
Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.
- Kurser
- 30
- Lektioner
- 120
Vanliga frågor
Är lektionen ”Skala och normalisera tal” gratis?
Ja – hela texten till ”Skala och normalisera tal” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i Data Science Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i Data Science Academy innehåller totalt 4 lektioner.
Vad lär jag mig i ”Skala och normalisera tal”?
Ge egenskaperna jämförbara skalor Ni övar på Data Science Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.
Behöver jag någon erfarenhet för att börja lära mig Data Science Academy?
Du behöver inga förkunskaper. Utbildningen i Data Science Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 3 av 4.
Hur lång tid tar lektionen ”Skala och normalisera tal”?
De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.
Kan jag skriva och köra kod i den här Data Science Academy-lektionen?
Ja. Varje Data Science Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.
Alla lektioner i den här kursen
- Dela in tal i kategorier
- Koda kategoriska kolumner
- Skala och normalisera tal
- Skapa egenskaper från datum och text