0Pricing
Python Academy · Lektion

Datenbereinigung und Vorverarbeitung

Verstehen Sie, wie Sie mit fehlenden Daten umgehen, Duplikate entfernen und Rohdaten für die Analyse vorverarbeiten.

Datenbereinigung und Vorverarbeitung ist eine kostenlose Python Academy-Lektion auf CoddyKit. Dies ist Lektion 4 von 5. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Python Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Python Academy-Kurs umfasst insgesamt 5 Lektionen.

Überblick über Datenbereinigung

Datenbereinigung und Vorverarbeitung

Rohdaten sind häufig uneinheitlich und müssen bereinigt und vorverarbeitet werden, bevor sie analysiert werden können. Diese Schritte sind entscheidend, um die Qualität und Genauigkeit Ihrer Analyse sicherzustellen.

In dieser Lektion lernen Sie Techniken zum Umgang mit fehlenden Daten, zum Entfernen von Duplikaten und zur Vorverarbeitung von Daten für die Analyse kennen.

Datenbereinigung und Vorverarbeitung — Illustration 1

Was ist Datenbereinigung?

Was ist Datenbereinigung?

Bei der Datenbereinigung werden Fehler in einem Datensatz identifiziert und behoben. Zu den häufigsten Aufgaben gehören:

  • Fehlende Werte behandeln.
  • Duplikate entfernen.
  • Formate vereinheitlichen.

Fehlende Daten behandeln

Fehlende Daten behandeln

Fehlende Daten können aus verschiedenen Gründen auftreten. Sie können damit umgehen, indem Sie:

  • Fehlende Werte durch einen Standardwert oder den Mittelwert/Median ersetzen.
  • Zeilen oder Spalten mit zu vielen fehlenden Werten entfernen.
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

Duplikate entfernen

Duplikate entfernen

Doppelte Daten können Ihre Analyse verzerren. Verwenden Sie Pandas, um Duplikate zu entfernen:

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

Daten standardisieren

Daten standardisieren

Die Datenstandardisierung sorgt für Konsistenz. Beispielsweise können Sie Datumsformate oder die Groß- und Kleinschreibung von Text vereinheitlichen:

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

Daten transformieren

Daten transformieren

Transformationen wie Skalierung und Kodierung gehören zur Vorverarbeitung:

  • Skalierung: Numerische Werte standardisieren.
  • Kodierung: Kategorische Daten in eine numerische Form umwandeln.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

Daten skalieren

Daten skalieren

Durch die Skalierung befinden sich numerische Daten auf derselben Skala, was für Machine-Learning-Algorithmen unerlässlich ist:

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

Daten validieren

Daten validieren

Durch die Validierung wird sichergestellt, dass die Daten Qualitätsstandards erfüllen. Prüfen Sie beispielsweise auf Ausreißer oder ungültige Werte:

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

Häufige Fehler bei der Datenbereinigung

Häufige Fehler bei der Datenbereinigung

Hier sind einige Fehler, die Sie vermeiden sollten:

  • Fehlende Daten zu ignorieren, was zu ungenauen Analysen führt.
  • Formate nicht zu vereinheitlichen, wodurch Inkonsistenzen entstehen.
  • Die Validierung zu vernachlässigen, was zu Fehlern bei nachgelagerten Aufgaben führt.

Was haben Sie gelernt?

Was haben Sie gelernt?

In dieser Lektion haben Sie Folgendes gelernt:

  • Wie Sie mit fehlenden Daten umgehen und Duplikate entfernen.
  • Wie Sie Daten für die Analyse vereinheitlichen, transformieren und skalieren.
  • Wie Sie die Datenqualität validieren und Ausreißer erkennen.
  • Wie wichtig die Datenbereinigung für eine genaue Analyse ist.

Sehr gut! Fahren wir mit dem nächsten Thema fort.

Datenbereinigung und Vorverarbeitung — Illustration 11

Häufig gestellte Fragen

Ist die Lektion „Datenbereinigung und Vorverarbeitung“ kostenlos?

Ja — der vollständige Text von „Datenbereinigung und Vorverarbeitung“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Python Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Python Academy-Kurs umfasst insgesamt 5 Lektionen.

Was lerne ich in „Datenbereinigung und Vorverarbeitung“?

Verstehen Sie, wie Sie mit fehlenden Daten umgehen, Duplikate entfernen und Rohdaten für die Analyse vorverarbeiten. Du übst Python Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Python Academy zu starten?

Keine Vorkenntnisse erforderlich. Python Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 5.

Wie lange dauert die Lektion „Datenbereinigung und Vorverarbeitung“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Python Academy-Lektion Code schreiben und ausführen?

Ja. Jede Python Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Was ist Data Science?
  2. Die Rolle von Python in Data Science
  3. Datenstrukturen für Data Science
  4. Datenbereinigung und Vorverarbeitung
  5. Explorative Datenanalyse (EDA)
← Zurück zu Python Academy