0Pricing
Learn AI with Python · Leçon

Analyse univariée

Graphiques de distribution, histogrammes, boîtes à moustaches et graphiques de dénombrement pour comprendre chaque caractéristique.

Analyse univariée est une leçon Learn AI with Python gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Learn AI with Python, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Learn AI with Python comprend 4 leçons au total.

Qu'est-ce que l'analyse univariée ?

L'analyse univariée examine une variable à la fois pour en comprendre la distribution : tendance centrale, dispersion, forme et valeurs inhabituelles.

Le graphique adapté dépend du type de variable :

  • Numérique → histogramme, KDE, boîte à moustaches, graphique en violon
  • Catégorielle → diagramme des effectifs (diagramme en barres des fréquences)

Configuration des bibliothèques de visualisation

Nous utilisons Matplotlib (plt) et Seaborn (sns). Seaborn s'appuie sur Matplotlib et propose des paramètres par défaut plus élégants pour les graphiques statistiques.

import matplotlib.pyplot as plt
import seaborn as sns
import pandas as pd

sns.set_theme(style="whitegrid")
df = pd.read_csv("data.csv")

Histogrammes avec plt.hist

Un histogramme répartit les valeurs numériques dans des intervalles et compte combien de valeurs appartiennent à chacun. Il révèle la forme générale d'une distribution.

L'argument bins contrôle le niveau de détail — trop peu d'intervalles masquent la structure, tandis qu'un nombre excessif ajoute du bruit.

plt.hist(df["age"], bins=30, edgecolor="black")
plt.xlabel("Age")
plt.ylabel("Count")
plt.title("Age Distribution")
plt.show()

Graphiques KDE — Densité lissée

Une estimation de densité par noyau (sns.kdeplot) trace une courbe lisse qui approxime la distribution ; elle peut être plus facile à lire que les barres irrégulières d'un histogramme.

Combinez les deux avec sns.histplot(..., kde=True) pour superposer la courbe lisse aux barres.

sns.kdeplot(df["age"], fill=True)
plt.show()

sns.histplot(df["age"], bins=30, kde=True)
plt.show()

Détecter l'asymétrie

Skew mesure l'asymétrie. Une longue queue vers la droite correspond à une asymétrie positive (à droite) ; une longue queue vers la gauche, à une asymétrie négative (à gauche).

Les revenus, les prix et les comptes présentent généralement une asymétrie à droite. Vous pouvez la quantifier avec df[col].skew() — les valeurs très éloignées de 0 indiquent une asymétrie.

print(df["income"].skew())   # e.g. 2.3 -> strong right skew
sns.histplot(df["income"], bins=40, kde=True)
plt.show()

Détecter la bimodalité

Une distribution bimodale possède deux pics. Cela indique souvent que deux groupes distincts sont mélangés (par exemple, deux types de produits dans une même colonne de prix).

Les graphiques KDE rendent la bimodalité évidente — recherchez deux bosses. C'est un indice qu'une variable catégorielle cachée pourrait expliquer cette séparation.

sns.kdeplot(df["price"], fill=True)
plt.title("Two peaks suggest two subpopulations")
plt.show()

Boîtes à moustaches avec sns.boxplot

Une boîte à moustaches montre la médiane (ligne centrale), l'écart interquartile (IQR, la boîte) et des moustaches qui s'étendent jusqu'à environ 1,5 × IQR. Les points situés au-delà des moustaches sont signalés comme des valeurs aberrantes.

sns.boxplot(x=df["income"])
plt.title("Income — box plot")
plt.show()

Valeurs aberrantes et règle de l'IQR

La boîte à moustaches utilise la règle de l'IQR : un point est une valeur aberrante s'il se trouve sous Q1 - 1.5*IQR ou au-dessus de Q3 + 1.5*IQR.

Vous pouvez calculer vous-même les bornes afin de filtrer ou de plafonner les valeurs extrêmes.

q1 = df["income"].quantile(0.25)
q3 = df["income"].quantile(0.75)
iqr = q3 - q1
low, high = q1 - 1.5*iqr, q3 + 1.5*iqr
outliers = df[(df["income"] < low) | (df["income"] > high)]
print(len(outliers), "outliers")

Graphiques en violon avec sns.violinplot

Un graphique en violon combine une boîte à moustaches avec une KDE en miroir. La largeur à chaque hauteur représente la densité : vous voyez donc à la fois la forme et les statistiques récapitulatives.

Les graphiques en violon sont parfaits pour révéler une asymétrie ou une bimodalité qu'une simple boîte à moustaches masquerait.

sns.violinplot(x=df["age"])
plt.title("Age — violin plot")
plt.show()

Graphiques des effectifs pour les variables catégorielles

Pour les colonnes catégorielles, utilisez sns.countplot — un diagramme en barres des fréquences des catégories. C'est la représentation visuelle de value_counts().

Pour faciliter la lecture, classez les barres par fréquence avec l'argument order.

order = df["city"].value_counts().index
sns.countplot(y="city", data=df, order=order)
plt.title("Records per city")
plt.show()

Choisir le bon graphique univarié

Guide de décision rapide :

  • Forme d'une colonne numérique → histogramme ou KDE
  • Valeurs aberrantes et quartiles → boîte à moustaches
  • Forme et résumé réunis → graphique en violon
  • Fréquences des catégories → graphique des effectifs

Vérification rapide : choix du graphique

Vous voulez voir la médiane, les quartiles et les valeurs aberrantes d'une seule colonne numérique.

Récapitulatif : analyse univariée

Vous avez appris à examiner une variable à la fois :

  • plt.hist et sns.kdeplot pour la forme de la distribution
  • .skew() pour quantifier l'asymétrie ; les bosses de la KDE pour la bimodalité
  • sns.boxplot et la règle de l'IQR pour les valeurs aberrantes
  • sns.violinplot pour réunir forme et résumé
  • sns.countplot pour les fréquences des catégories

Nous allons ensuite examiner les relations entre deux variables ou davantage.

Questions Fréquemment Posées

La leçon « Analyse univariée » est-elle gratuite ?

Oui — le texte complet de « Analyse univariée » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Learn AI with Python, passe à CoddyKit PRO. Le cours Learn AI with Python comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Analyse univariée » ?

Graphiques de distribution, histogrammes, boîtes à moustaches et graphiques de dénombrement pour comprendre chaque caractéristique. Tu pratiques Learn AI with Python avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer Learn AI with Python ?

Aucune expérience préalable n'est requise. Learn AI with Python sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.

Combien de temps prend la leçon « Analyse univariée » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon Learn AI with Python ?

Oui. Chaque leçon Learn AI with Python inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Flux de travail EDA et profilage des données
  2. Analyse univariée
  3. Analyse bivariée et multivariée
  4. Distribution des caractéristiques et analyse de la cible
← Retour à Learn AI with Python