Data Science Academy · Lektion

Imputera med medelvärde, median eller typvärde

Rimliga ersättningsvärden för olika kolumntyper

Lektion 3 av 413 steg

Imputera med medelvärde, median eller typvärde är en gratis lektion i Data Science Academy på CoddyKit. Detta är lektion 3 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för Data Science Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i Data Science Academy innehåller totalt 4 lektioner.

Fylla i med ett statistiskt mått

I stället för att hitta på slumpmässiga tal fyller du luckor med ett sammanfattande värde från själva kolumnen. Denna noggranna metod kallas imputation. 🧮

Fylla i med medelvärdet

För tal är det enklaste valet mean, alltså kolumnens medelvärde. Det bevarar ungefär den totala nivån när antalet luckor är litet.

df['age'].fillna(df['age'].mean())

När medelvärdet blir missvisande

Medelvärdet är känsligt: några få mycket stora värden drar det långt från mitten. I snedfördelad data kan imputering med medelvärdet dra varje lucka mot ett unrealistic värde.

Fylla i med medianen

Median är det mittersta värdet och påverkas knappt av extrema avvikare. För snedfördelade numeriska kolumner är den vanligtvis ett säkrare val.

df['income'].fillna(df['income'].median())

Medelvärde eller median?

En snabb regel är att välja median när en kolumn innehåller avvikare eller har en lång svans, och medelvärdet endast när värdena är relativt symmetriska.

Typvärdet för kategorier

Text- och kategorikolumner har inget medelvärde. För dem fyller du i mode, det vanligaste värdet, eftersom det sannolikt passar bäst.

top = df['city'].mode()[0]
df['city'].fillna(top)

Varför mode returnerar en Series

Flera värden kan dela på förstaplatsen, så mode() returnerar en Series med alla vinnare. Välj det första med index 0 när du behöver ett enda värde.

df['city'].mode()[0]

Fyll i utifrån kolumntyp

Bästa praxis är att imputera varje kolumn utifrån dess type: median för snedfördelade tal, medelvärde för symmetriska tal och typvärde för kategorier.

Framåt- och bakåtfyllnad

För ordnade data, till exempel tidsserier, för du det senast kända värdet framåt med ffill, eller hämtar nästa värde bakåt med bfill.

df['temp'].ffill()

Den dolda kostnaden

Varje imputering minskar kolumnens naturliga spridning, eftersom de ifyllda värdena samlas kring en punkt. Tänk på detta, eftersom det sänker din variance.

Markera det du fyllde i

En professionell vana är att lägga till en boolesk kolumn som markerar vilka rader som imputerats. Denna flag visar senare analyser vilka värden som var verkliga och vilka som uppskattades.

df['age_filled'] = df['age'].isna()

Snabbkontroll

En inkomstkolumn är kraftigt snedfördelad på grund av några miljonärer. Vilken imputering passar bäst?

Sammanfattning: Smarta ifyllnader

Nu imputerar du med mean, median, or mode utifrån kolumntyp, använder ffill för ordnade data och markerar ifyllda rader så att inget döljs.

Gratis att börja

Lär dig Python med en AI-lärare – gratis

Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.

Kurser
30
Lektioner
120

Vanliga frågor

Är lektionen ”Imputera med medelvärde, median eller typvärde” gratis?

Ja – hela texten till ”Imputera med medelvärde, median eller typvärde” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i Data Science Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i Data Science Academy innehåller totalt 4 lektioner.

Vad lär jag mig i ”Imputera med medelvärde, median eller typvärde”?

Rimliga ersättningsvärden för olika kolumntyper Ni övar på Data Science Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.

Behöver jag någon erfarenhet för att börja lära mig Data Science Academy?

Du behöver inga förkunskaper. Utbildningen i Data Science Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 3 av 4.

Hur lång tid tar lektionen ”Imputera med medelvärde, median eller typvärde”?

De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.

Kan jag skriva och köra kod i den här Data Science Academy-lektionen?

Ja. Varje Data Science Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.

Alla lektioner i den här kursen

  1. Hitta NaN-värdena som döljer sig i tabellen
  2. Ta bort eller fyll i: välj klokt
  3. Imputera med medelvärde, median eller typvärde
  4. Korrigera dtypes och duplicerade rader
← Tillbaka till Data Science Academy