Python Academy · Lektion

Datarensning og forbehandling

Forstå, hvordan du håndterer manglende data, fjerner dubletter og forbehandler rå data til analyse.

Lektion 4 af 511 trin

Datarensning og forbehandling er en gratis Python Academy-lektion på CoddyKit. Dette er lektion 4 af 5. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Python Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Python Academy-kurset indeholder 5 lektioner i alt.

Oversigt over datarensning

Datarensning og forbehandling

Rådata er ofte rodet og kræver rensning og forbehandling, før de kan analyseres. Disse trin er afgørende for at sikre kvaliteten og nøjagtigheden af din analyse.

I denne lektion lærer du teknikker til at håndtere manglende data, fjerne dubletter og forbehandle data til analyse.

Datarensning og forbehandling — illustration 1

Hvad er datarensning?

Datarensning omfatter identifikation og rettelse af fejl i datasættet. Almindelige opgaver omfatter:

  • Håndtering af manglende værdier.
  • Fjernelse af dubletter.
  • Standardisering af formater.

Håndtering af manglende data

Manglende data kan opstå af forskellige årsager. Du kan håndtere dem ved at:

  • Udfylde manglende værdier med en standardværdi, et gennemsnit eller en median.
  • Fjerne rækker eller kolonner, der indeholder for mange manglende værdier.
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

Fjernelse af dubletter

Dublerede data kan forvrænge din analyse. Brug Pandas til at fjerne dubletter:

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

Standardisering af data

Datastandardisering sikrer ensartethed. Du kan for eksempel standardisere datoformater eller brugen af store og små bogstaver i tekst:

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

Transformation af data

Transformationer som skalering og kodning er en del af forbehandlingen:

  • Skalering: Standardisering af numeriske værdier.
  • Kodning: Konvertering af kategoriske data til numerisk format.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

Skalering af data

Skalering sikrer, at numeriske data er på samme skala, hvilket er afgørende for maskinlæringsalgoritmer:

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

Validering af data

Validering sikrer, at data lever op til kvalitetsstandarderne. Kontrollér for eksempel, om der er afvigere eller ugyldige værdier:

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

Almindelige fejl ved datarensning

Her er nogle fejl, du bør undgå:

  • At ignorere manglende data, hvilket fører til unøjagtig analyse.
  • Ikke at standardisere formater, hvilket skaber uoverensstemmelser.
  • At overse validering, hvilket fører til fejl i efterfølgende opgaver.

Hvad har du lært?

I denne lektion har du lært:

  • Hvordan du håndterer manglende data og fjerner dubletter.
  • Hvordan du standardiserer, transformerer og skalerer data til analyse.
  • Hvordan du validerer datakvaliteten og identificerer afvigere.
  • Hvor vigtigt det er at rense data for at opnå en nøjagtig analyse.

Godt gået! Lad os gå videre til det næste emne.

Datarensning og forbehandling — illustration 11
Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
76
Lektioner
320

Ofte stillede spørgsmål

Er lektionen “Datarensning og forbehandling” gratis?

Ja — hele teksten til “Datarensning og forbehandling” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Python Academy-kurset, skal du opgradere til CoddyKit PRO. Python Academy-kurset indeholder 5 lektioner i alt.

Hvad lærer jeg i “Datarensning og forbehandling”?

Forstå, hvordan du håndterer manglende data, fjerner dubletter og forbehandler rå data til analyse. Du øver dig i Python Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Python Academy?

Der kræves ingen tidligere erfaring. Python Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 4 af 5.

Hvor lang tid tager lektionen “Datarensning og forbehandling”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Python Academy-lektion?

Ja. Alle Python Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Hvad er datalogi?
  2. Pythons rolle i datalogi
  3. Datastrukturer til datalogi
  4. Datarensning og forbehandling
  5. Eksplorativ dataanalyse (EDA)
← Tilbage til Python Academy