Python Academy · Les

Gegevens opschonen en voorbewerken

Begrijp hoe u ontbrekende gegevens verwerkt, duplicaten verwijdert en onbewerkte gegevens voorbereidt voor analyse

Les 4 van 511 stappen

Gegevens opschonen en voorbewerken is een gratis Python Academy-les op CoddyKit. Dit is les 4 van 5. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Python Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Python Academy bevat in totaal 5 lessen.

Overzicht van het opschonen van gegevens

Gegevens opschonen en voorbewerken

Onbewerkte gegevens zijn vaak rommelig en moeten worden opgeschoond en voorbewerkt voordat je ze kunt analyseren. Deze stappen zijn essentieel om de kwaliteit en nauwkeurigheid van je analyse te waarborgen.

In deze les leer je technieken om ontbrekende gegevens te verwerken, dubbele gegevens te verwijderen en gegevens voor te bewerken voor analyse.

Gegevens opschonen en voorbewerken — illustratie 1

Wat houdt gegevens opschonen in?

Bij het opschonen van gegevens identificeer en herstel je fouten in de gegevensverzameling. Veelvoorkomende taken zijn:

  • Ontbrekende waarden verwerken.
  • Dubbele gegevens verwijderen.
  • Indelingen standaardiseren.

Ontbrekende gegevens verwerken

Ontbrekende gegevens kunnen verschillende oorzaken hebben. Je kunt ze als volgt verwerken:

  • Ontbrekende waarden invullen met een standaardwaarde, het gemiddelde of de mediaan.
  • Rijen of kolommen verwijderen waarin te veel waarden ontbreken.
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

Dubbele gegevens verwijderen

Dubbele gegevens kunnen je analyse vertekenen. Gebruik Pandas om dubbele gegevens te verwijderen:

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

Gegevens standaardiseren

Gegevensstandaardisatie zorgt voor consistentie. Je kunt bijvoorbeeld datumnotaties of het hoofdlettergebruik in tekst standaardiseren:

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

Gegevens transformeren

Transformaties zoals schalen en coderen maken deel uit van de voorbewerking:

  • Schalen: Numerieke waarden standaardiseren.
  • Coderen: Categorische gegevens omzetten naar een numerieke vorm.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

Gegevens schalen

Schalen zorgt ervoor dat numerieke gegevens dezelfde schaal hebben, wat essentieel is voor algoritmen voor machine learning:

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

Gegevens valideren

Validatie zorgt ervoor dat de gegevens aan kwaliteitsnormen voldoen. Controleer bijvoorbeeld op uitschieters of ongeldige waarden:

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

Veelgemaakte fouten bij het opschonen van gegevens

Dit zijn enkele fouten die je moet vermijden:

  • Ontbrekende gegevens negeren, waardoor analyses onnauwkeurig worden.
  • Indelingen niet standaardiseren, waardoor inconsistenties ontstaan.
  • Validatie over het hoofd zien, waardoor fouten in vervolgtaken ontstaan.

Wat heb je geleerd?

In deze les heb je geleerd:

  • Hoe je met ontbrekende gegevens omgaat en duplicaten verwijdert.
  • Hoe je gegevens standaardiseert, transformeert en schaalt voor analyse.
  • Hoe je de gegevenskwaliteit valideert en uitschieters identificeert.
  • Waarom het opschonen van gegevens belangrijk is voor een nauwkeurige analyse.

Goed gedaan! Laten we doorgaan naar het volgende onderwerp.

Gegevens opschonen en voorbewerken — illustratie 11
Gratis beginnen

Leer Python met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
76
Lessen
320

Veelgestelde vragen

Is de les “Gegevens opschonen en voorbewerken” gratis?

Ja — de volledige tekst van “Gegevens opschonen en voorbewerken” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus Python Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus Python Academy bevat in totaal 5 lessen.

Wat leer ik in “Gegevens opschonen en voorbewerken”?

Begrijp hoe u ontbrekende gegevens verwerkt, duplicaten verwijdert en onbewerkte gegevens voorbereidt voor analyse Je oefent met Python Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met Python Academy te beginnen?

Ervaring vooraf is niet nodig. Python Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 5.

Hoe lang duurt de les “Gegevens opschonen en voorbewerken”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over Python Academy?

Ja. Elke les over Python Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Wat is datawetenschap?
  2. De rol van Python in datawetenschap
  3. Gegevensstructuren voor datawetenschap
  4. Gegevens opschonen en voorbewerken
  5. Verkennende gegevensanalyse (EDA)
← Terug naar Python Academy