0Pricing
Data Science Academy · Lektion

dtypes und doppelte Zeilen korrigieren

Datentypen erzwingen und Wiederholungen löschen

dtypes und doppelte Zeilen korrigieren ist eine kostenlose Data Science Academy-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Data Science Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Data Science Academy-Kurs umfasst insgesamt 4 Lektionen.

Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.

Clean Goes Beyond Gaps

Filling missing values is only half the job. Clean data also needs correct dtypes and no accidental duplicate rows muddying your counts. 🧹

What a dtype Is

Every column has a dtype, its data type, like int, float, object, or datetime. The dtype controls which operations the column even allows.

df.dtypes

Numbers Stuck as Text

A frequent mess: numbers loaded as object strings because one stray symbol crept in. You cannot do math on them until the type is fixed.

Coerce With to_numeric

Convert a text column to numbers with to_numeric. Pass errors='coerce' to turn anything unparseable into NaN instead of crashing.

df['price'] = pd.to_numeric(df['price'], errors='coerce')

Cast With astype

When a column is already clean, astype changes its type directly, for example turning whole-number floats back into compact integers.

df['count'] = df['count'].astype(int)

Fix Date Columns

Dates often arrive as text. Convert them with to_datetime so you can sort, filter by range, and extract parts like month later.

df['date'] = pd.to_datetime(df['date'])

Category to Save Memory

Columns with few repeated text values shrink dramatically as the category dtype, which stores each label once and references it.

df['city'] = df['city'].astype('category')

Spotting Duplicate Rows

Repeated records inflate totals and averages. Find them with duplicated(), which flags each row that has appeared before as True.

df.duplicated().sum()

Dropping Duplicates

Remove repeats with drop_duplicates(). By default it keeps the first occurrence of each row and discards the rest.

df = df.drop_duplicates()

Duplicates by Key Columns

Sometimes only certain columns define a duplicate. Pass subset to detect repeats based on a key like an id, ignoring the other columns.

df.drop_duplicates(subset=['user_id'])

Verify Before You Move On

After fixing types and repeats, run info() once more. Confirming dtypes and row counts protects you from cleaning errors slipping downstream.

df.info()

Quick Check

A price column loaded as object text. Which call safely turns bad entries into NaN?

Recap: Types and Dupes Tamed

You now fix dtypes with to_numeric, astype, and to_datetime, and clear repeats with drop_duplicates. Your table is finally analysis-ready.

Häufig gestellte Fragen

Ist die Lektion „dtypes und doppelte Zeilen korrigieren“ kostenlos?

Ja — der vollständige Text von „dtypes und doppelte Zeilen korrigieren“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Data Science Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Data Science Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „dtypes und doppelte Zeilen korrigieren“?

Datentypen erzwingen und Wiederholungen löschen Du übst Data Science Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Data Science Academy zu starten?

Keine Vorkenntnisse erforderlich. Data Science Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.

Wie lange dauert die Lektion „dtypes und doppelte Zeilen korrigieren“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Data Science Academy-Lektion Code schreiben und ausführen?

Ja. Jede Data Science Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Die verborgenen NaNs in Ihrer Tabelle finden
  2. Löschen oder auffüllen: mit Bedacht wählen
  3. Mit Mittelwert, Median oder Modus imputieren
  4. dtypes und doppelte Zeilen korrigieren
← Zurück zu Data Science Academy