0Pricing
Python For Kids · Lektion

Datenbereinigung und Vorverarbeitung

Verstehen Sie, wie Sie mit fehlenden Daten umgehen, Duplikate entfernen und Rohdaten für die Analyse vorverarbeiten.

Datenbereinigung und Vorverarbeitung ist eine kostenlose Python For Kids-Lektion auf CoddyKit. Dies ist Lektion 4 von 5. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Python For Kids-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Python For Kids-Kurs umfasst insgesamt 5 Lektionen.

Überblick über die Datenbereinigung

Datenbereinigung und Vorverarbeitung

Rohdaten sind häufig unstrukturiert und müssen bereinigt und vorverarbeitet werden, bevor sie analysiert werden können. Diese Schritte sind entscheidend, um die Qualität und Genauigkeit Ihrer Analyse sicherzustellen.

In dieser Lektion lernen Sie Techniken kennen, um mit fehlenden Daten umzugehen, Duplikate zu entfernen und Daten für die Analyse vorzuverarbeiten.

Datenbereinigung und Vorverarbeitung — Illustration 1

Was ist Datenbereinigung?

Bei der Datenbereinigung werden Fehler in einem Datensatz identifiziert und behoben. Zu den häufigsten Aufgaben gehören:

  • Fehlende Werte zu behandeln.
  • Duplikate zu entfernen.
  • Formate zu standardisieren.

Umgang mit fehlenden Daten

Fehlende Daten können aus verschiedenen Gründen auftreten. Sie können damit folgendermaßen umgehen:

  • Fehlende Werte durch einen Standardwert oder den Mittelwert bzw. Median ersetzen.
  • Zeilen oder Spalten mit zu vielen fehlenden Werten entfernen.
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

Duplikate entfernen

Doppelte Daten können Ihre Analyse verzerren. Verwenden Sie Pandas, um Duplikate zu entfernen:

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

Daten standardisieren

Die Standardisierung von Daten sorgt für Konsistenz. Sie können beispielsweise Datumsformate oder die Groß- und Kleinschreibung von Text standardisieren:

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

Daten transformieren

Transformationen wie Skalierung und Kodierung gehören zur Vorverarbeitung:

  • Skalierung: Numerische Werte standardisieren.
  • Kodierung: Kategorische Daten in numerische Werte umwandeln.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

Daten skalieren

Durch die Skalierung liegen numerische Daten auf derselben Skala. Das ist für Algorithmen des maschinellen Lernens unerlässlich:

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

Daten validieren

Durch die Validierung wird sichergestellt, dass die Daten Qualitätsstandards erfüllen. Prüfen Sie beispielsweise auf Ausreißer oder ungültige Werte:

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

Häufige Fehler bei der Datenbereinigung

Hier sind einige Fehler, die Sie vermeiden sollten:

  • Fehlende Daten zu ignorieren, was zu ungenauen Analysen führt.
  • Formate nicht zu standardisieren, wodurch Inkonsistenzen entstehen.
  • Die Validierung zu vernachlässigen, was zu Fehlern bei nachgelagerten Aufgaben führt.

Was haben Sie gelernt?

In dieser Lektion haben Sie Folgendes gelernt:

  • Wie Sie mit fehlenden Daten umgehen und Duplikate entfernen.
  • Wie Sie Daten für die Analyse standardisieren, transformieren und skalieren.
  • Wie Sie die Datenqualität validieren und Ausreißer erkennen.
  • Warum die Datenbereinigung für eine genaue Analyse wichtig ist.

Sehr gut! Fahren Sie nun mit dem nächsten Thema fort.

Datenbereinigung und Vorverarbeitung — Illustration 11

Häufig gestellte Fragen

Ist die Lektion „Datenbereinigung und Vorverarbeitung“ kostenlos?

Ja — der vollständige Text von „Datenbereinigung und Vorverarbeitung“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Python For Kids-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Python For Kids-Kurs umfasst insgesamt 5 Lektionen.

Was lerne ich in „Datenbereinigung und Vorverarbeitung“?

Verstehen Sie, wie Sie mit fehlenden Daten umgehen, Duplikate entfernen und Rohdaten für die Analyse vorverarbeiten. Du übst Python For Kids mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Python For Kids zu starten?

Keine Vorkenntnisse erforderlich. Python For Kids auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 5.

Wie lange dauert die Lektion „Datenbereinigung und Vorverarbeitung“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Python For Kids-Lektion Code schreiben und ausführen?

Ja. Jede Python For Kids-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Was ist Data Science?
  2. Die Rolle von Python in Data Science
  3. Datenstrukturen für Data Science
  4. Datenbereinigung und Vorverarbeitung
  5. Explorative Datenanalyse (EDA)
← Zurück zu Python For Kids