Python Academy · leksjon

Datarensing og forbehandling

Forstå hvordan du håndterer manglende data, fjerner duplikater og forbehandler rådata for analyse.

Leksjon 4 av 511 trinn

Datarensing og forbehandling er en gratis leksjon i Python Academy på CoddyKit. Dette er leksjon 4 av 5. Du kan lese hele leksjonen gratis nedenfor – og deretter øve praktisk i nettleseren med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i Python Academy, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i Python Academy inneholder totalt 5 leksjoner.

Oversikt over datarensing

Datarensing og forbehandling

Rådata er ofte uoversiktlige og må renses og forbehandles før de kan analyseres. Disse trinnene er avgjørende for å sikre kvaliteten og nøyaktigheten til analysen.

I denne leksjonen skal du lære teknikker for å håndtere manglende data, fjerne duplikater og forbehandle data for analyse.

Datarensing og forbehandling — illustrasjon 1

Hva er datarensing?

Datarensing innebærer å identifisere og rette opp feil i datasettet. Vanlige oppgaver omfatter:

  • Håndtering av manglende verdier.
  • Fjerning av duplikater.
  • Standardisering av formater.

Håndtering av manglende data

Manglende data kan oppstå av ulike årsaker. Du kan håndtere dem ved å:

  • Fylle inn manglende verdier med en standardverdi eller gjennomsnitt/median.
  • Fjerne rader eller kolonner med for mange manglende verdier.
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

Fjerne duplikater

Dupliserte data kan gi et skjevt bilde av analysen. Bruk Pandas til å fjerne duplikater:

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

Standardisere data

Standardisering av data sikrer konsistens. Du kan for eksempel standardisere datoformater eller bruk av store og små bokstaver i tekst:

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

Transformere data

Transformasjoner som skalering og koding er en del av forbehandlingen:

  • Skalering: Standardisering av numeriske verdier.
  • Koding: Konvertering av kategoriske data til numerisk format.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

Skalering av data

Skalering sørger for at numeriske data er på samme skala, noe som er avgjørende for maskinlæringsalgoritmer:

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

Validering av data

Validering sørger for at dataene oppfyller kvalitetskravene. Du kan for eksempel kontrollere om det finnes uteliggere eller ugyldige verdier:

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

Vanlige feil ved datavask

Her er noen feil du bør unngå:

  • Å ignorere manglende data, noe som kan føre til unøyaktig analyse.
  • Å ikke standardisere formater, noe som kan føre til inkonsistens.
  • Å overse validering, noe som kan føre til feil i etterfølgende oppgaver.

Hva har vi lært?

I denne leksjonen har du lært:

  • Hvordan du håndterer manglende data og fjerner duplikater.
  • Hvordan du standardiserer, transformerer og skalerer data for analyse.
  • Hvordan du validerer datakvalitet og identifiserer uteliggere.
  • Hvor viktig datavask er for å oppnå nøyaktig analyse.

Godt jobbet! La oss gå videre til neste tema.

Datarensing og forbehandling — illustrasjon 11
Gratis å komme i gang

Lær deg Python med en AI-veileder – gratis

Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.

Kurs
76
Leksjoner
320

Ofte stilte spørsmål

Er leksjonen «Datarensing og forbehandling» gratis?

Ja – hele teksten i «Datarensing og forbehandling» er gratis å lese her på nettet. For å øve interaktivt med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt, og for å låse opp resten av Python Academy-kurset, kan du oppgradere til CoddyKit PRO. Kurset i Python Academy inneholder totalt 5 leksjoner.

Hva lærer jeg i «Datarensing og forbehandling»?

Forstå hvordan du håndterer manglende data, fjerner duplikater og forbehandler rådata for analyse. Du øver på Python Academy med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.

Trenger jeg erfaring for å begynne med Python Academy?

Ingen tidligere erfaring er nødvendig. Python Academy på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 4 av 5.

Hvor lang tid tar leksjonen «Datarensing og forbehandling»?

De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.

Kan jeg skrive og kjøre kode i denne Python Academy-leksjonen?

Ja. Alle Python Academy-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.

Alle leksjonene i dette kurset

  1. Hva er datavitenskap?
  2. Pythons rolle i datavitenskap
  3. Datastrukturer for datavitenskap
  4. Datarensing og forbehandling
  5. Utforskende dataanalyse (EDA)
← Tilbake til Python Academy