0Pricing
Data Science Academy · Leçon

Corriger les dtypes et les lignes en double

Convertir les types et supprimer les répétitions

Corriger les dtypes et les lignes en double est une leçon Data Science Academy gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Data Science Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Data Science Academy comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

Clean Goes Beyond Gaps

Filling missing values is only half the job. Clean data also needs correct dtypes and no accidental duplicate rows muddying your counts. 🧹

What a dtype Is

Every column has a dtype, its data type, like int, float, object, or datetime. The dtype controls which operations the column even allows.

df.dtypes

Numbers Stuck as Text

A frequent mess: numbers loaded as object strings because one stray symbol crept in. You cannot do math on them until the type is fixed.

Coerce With to_numeric

Convert a text column to numbers with to_numeric. Pass errors='coerce' to turn anything unparseable into NaN instead of crashing.

df['price'] = pd.to_numeric(df['price'], errors='coerce')

Cast With astype

When a column is already clean, astype changes its type directly, for example turning whole-number floats back into compact integers.

df['count'] = df['count'].astype(int)

Fix Date Columns

Dates often arrive as text. Convert them with to_datetime so you can sort, filter by range, and extract parts like month later.

df['date'] = pd.to_datetime(df['date'])

Category to Save Memory

Columns with few repeated text values shrink dramatically as the category dtype, which stores each label once and references it.

df['city'] = df['city'].astype('category')

Spotting Duplicate Rows

Repeated records inflate totals and averages. Find them with duplicated(), which flags each row that has appeared before as True.

df.duplicated().sum()

Dropping Duplicates

Remove repeats with drop_duplicates(). By default it keeps the first occurrence of each row and discards the rest.

df = df.drop_duplicates()

Duplicates by Key Columns

Sometimes only certain columns define a duplicate. Pass subset to detect repeats based on a key like an id, ignoring the other columns.

df.drop_duplicates(subset=['user_id'])

Verify Before You Move On

After fixing types and repeats, run info() once more. Confirming dtypes and row counts protects you from cleaning errors slipping downstream.

df.info()

Quick Check

A price column loaded as object text. Which call safely turns bad entries into NaN?

Recap: Types and Dupes Tamed

You now fix dtypes with to_numeric, astype, and to_datetime, and clear repeats with drop_duplicates. Your table is finally analysis-ready.

Questions Fréquemment Posées

La leçon « Corriger les dtypes et les lignes en double » est-elle gratuite ?

Oui — le texte complet de « Corriger les dtypes et les lignes en double » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Data Science Academy, passe à CoddyKit PRO. Le cours Data Science Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Corriger les dtypes et les lignes en double » ?

Convertir les types et supprimer les répétitions Tu pratiques Data Science Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer Data Science Academy ?

Aucune expérience préalable n'est requise. Data Science Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.

Combien de temps prend la leçon « Corriger les dtypes et les lignes en double » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon Data Science Academy ?

Oui. Chaque leçon Data Science Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Repérer les NaNs cachés dans votre table
  2. Supprimer ou remplir : choisir judicieusement
  3. Imputer avec la moyenne, la médiane ou le mode
  4. Corriger les dtypes et les lignes en double
← Retour à Data Science Academy