Nettoyage et prétraitement des données
Comprenez comment gérer les données manquantes, supprimer les doublons et prétraiter les données brutes pour l’analyse.
Nettoyage et prétraitement des données est une leçon Python Academy gratuite sur CoddyKit. Ceci est la leçon 4 sur 5. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Python Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Python Academy comprend 5 leçons au total.
Vue d'ensemble du nettoyage des données
Nettoyage et prétraitement des données
Les données brutes sont souvent désordonnées et nécessitent un nettoyage et un prétraitement avant de pouvoir être analysées. Ces étapes sont essentielles pour garantir la qualité et l'exactitude de votre analyse.
Dans cette leçon, vous découvrirez des techniques pour traiter les données manquantes, supprimer les doublons et prétraiter les données avant leur analyse.

Qu'est-ce que le nettoyage des données ?
Qu'est-ce que le nettoyage des données ?
Le nettoyage des données consiste à repérer et à corriger les erreurs dans le jeu de données. Les tâches courantes comprennent :
- Traiter les valeurs manquantes.
- Supprimer les doublons.
- Standardiser les formats.
Traiter les données manquantes
Traiter les données manquantes
Les données manquantes peuvent apparaître pour diverses raisons. Vous pouvez les traiter en :
- Remplaçant les valeurs manquantes par une valeur par défaut, mean ou la médiane.
- Supprimant les lignes ou les colonnes qui contiennent trop de valeurs manquantes.
# Example: Handling missing data
import pandas as pd
data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)Supprimer les doublons
Supprimer les doublons
Les données en double peuvent fausser votre analyse. Utilisez Pandas pour supprimer les doublons :
# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)Standardiser les données
Standardiser les données
La standardisation des données garantit leur cohérence. Par exemple, vous pouvez standardiser les formats de date ou la casse du texte :
# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)Transformer les données
Transformer les données
Les transformations comme la mise à l'échelle et l'encodage font partie du prétraitement :
- Mise à l'échelle : Standardiser les valeurs numériques.
- Encodage : Convertir les données catégorielles en format numérique.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder
data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)Mise à l’échelle des données
Mise à l’échelle des données
La mise à l’échelle garantit que les données numériques sont exprimées sur la même échelle, ce qui est essentiel pour les algorithmes d’apprentissage automatique :
# Example: Scaling data
from sklearn.preprocessing import StandardScaler
values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)Validation des données
Validation des données
La validation garantit que les données respectent les normes de qualité. Par exemple, recherchez les valeurs aberrantes ou non valides :
# Example: Validating data
import numpy as np
data = [10, 20, 1000] # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)Erreurs courantes lors du nettoyage des données
Erreurs courantes lors du nettoyage des données
Voici quelques erreurs à éviter :
- Ignorer les données manquantes, ce qui entraîne une analyse inexacte.
- Ne pas standardiser les formats, ce qui provoque des incohérences.
- Négliger la validation, ce qui entraîne des erreurs dans les tâches ultérieures.
Qu’avons-nous appris ?
Qu’avons-nous appris ?
Dans cette leçon, vous avez appris :
- À gérer les données manquantes et à supprimer les doublons.
- À standardiser, transformer et mettre les données à l’échelle pour les analyser.
- À valider la qualité des données et à repérer les valeurs aberrantes.
- L’importance du nettoyage des données pour obtenir une analyse exacte.
Excellent travail ! Passons au sujet suivant.

Questions Fréquemment Posées
La leçon « Nettoyage et prétraitement des données » est-elle gratuite ?
Oui — le texte complet de « Nettoyage et prétraitement des données » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Python Academy, passe à CoddyKit PRO. Le cours Python Academy comprend 5 leçons au total.
Qu'est-ce que j'apprendrai dans « Nettoyage et prétraitement des données » ?
Comprenez comment gérer les données manquantes, supprimer les doublons et prétraiter les données brutes pour l’analyse. Tu pratiques Python Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer Python Academy ?
Aucune expérience préalable n'est requise. Python Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 5.
Combien de temps prend la leçon « Nettoyage et prétraitement des données » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon Python Academy ?
Oui. Chaque leçon Python Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Qu’est-ce que la science des données ?
- Le rôle de Python en science des données
- Structures de données pour la science des données
- Nettoyage et prétraitement des données
- Analyse exploratoire des données (EDA)