0Pricing
Python Academy · Leçon

Projet de regroupement par K-moyennes

Application à un jeu de données réel

Projet de regroupement par K-moyennes est une leçon Python Academy gratuite sur CoddyKit. Ceci est la leçon 3 sur 5. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Python Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Python Academy comprend 5 leçons au total.

Projet de regroupement par K-moyennes

Projet de regroupement par K-moyennes

Dans ce projet, nous appliquerons le regroupement par K-moyennes à un jeu de données réel : la segmentation de clients. L’objectif est de regrouper les clients en fonction de leurs habitudes de dépenses.

Projet de regroupement par K-moyennes — illustration 1

Présentation du jeu de données

Présentation du jeu de données

Le jeu de données contient les colonnes suivantes :

  • ID client : Identifiant unique de chaque client.
  • Âge : Âge du client.
  • Revenu annuel : Revenu annuel en milliers de dollars.
  • Score de dépenses : Score attribué en fonction du comportement et des habitudes de dépenses du client (1–100).

Étape 1 : importer le jeu de données et les bibliothèques

Étape 1 : importer le jeu de données et les bibliothèques

Nous commencerons par importer les bibliothèques nécessaires et charger le jeu de données :

import pandas as pd
import matplotlib.pyplot as plt
from sklearn.cluster import KMeans

# Load dataset
data = pd.read_csv('Mall_Customers.csv')
print(data.head())

Étape 2 : prétraiter les données

Étape 2 : prétraiter les données

Nous sélectionnerons les caractéristiques pertinentes pour le regroupement et normaliserons les données si nécessaire. Pour ce projet, nous utiliserons le revenu annuel et le score de dépenses :

# Select relevant features
X = data[['Annual Income (k$)', 'Spending Score (1-100)']].values
print(X[:5])

Étape 3 : déterminer le nombre optimal de groupes

Étape 3 : déterminer le nombre optimal de groupes

Nous utilisons la méthode du coude pour trouver le nombre optimal de groupes en représentant graphiquement la somme des carrés intra-groupes (WCSS) pour différentes valeurs de K :

wcss = []
for i in range(1, 11):
    kmeans = KMeans(n_clusters=i, init='k-means++', random_state=42)
    kmeans.fit(X)
    wcss.append(kmeans.inertia_)

plt.plot(range(1, 11), wcss)
plt.title('Elbow Method')
plt.xlabel('Number of Clusters')
plt.ylabel('WCSS')
plt.show()

Étape 4 : appliquer le regroupement par K-moyennes

Étape 4 : appliquer le regroupement par K-moyennes

En nous basant sur la méthode du coude, nous choisissons le nombre optimal de groupes (par exemple, K=5), puis nous utilisons fit sur le modèle K-moyennes :

kmeans = KMeans(n_clusters=5, init='k-means++', random_state=42)
kmeans.fit(X)

# Add cluster labels to the dataset
data['Cluster'] = kmeans.labels_
print(data.head())

Étape 5 : visualiser les groupes

Étape 5 : visualiser les groupes

Nous pouvons représenter graphiquement les groupes dans un espace en 2D afin d’observer leur séparation :

plt.scatter(X[:, 0], X[:, 1], c=kmeans.labels_, cmap='viridis')
plt.scatter(kmeans.cluster_centers_[:, 0], kmeans.cluster_centers_[:, 1], s=200, c='red', marker='X')
plt.title('Customer Segmentation')
plt.xlabel('Annual Income (k$)')
plt.ylabel('Spending Score (1-100)')
plt.show()

Étape 6 : interpréter les groupes

Étape 6 : interpréter les groupes

Chaque groupe représente un ensemble de clients ayant des habitudes de dépenses similaires. Par exemple :

  • Groupe 1 : revenus élevés, dépenses élevées.
  • Groupe 2 : revenus faibles, dépenses faibles.
  • Groupe 3 : revenus modérés, dépenses élevées.

Difficultés du regroupement dans des situations réelles

Difficultés du regroupement dans des situations réelles

Bien que le regroupement soit puissant, les applications réelles doivent relever des difficultés telles que :

  • Les jeux de données à haute dimension.
  • Les données bruitées ou incomplètes.
  • L’interprétation pertinente des résultats des groupes.

Résumé et prochaines étapes

Résumé et prochaines étapes

Dans ce projet, nous avons :

  • Exploré un jeu de données réel.
  • Appliqué le regroupement par K-moyennes et visualisé les résultats.
  • Interprété les groupes afin de comprendre le comportement des clients.

Ensuite, nous découvrirons les techniques de réduction de dimensionnalité telles que PCA et t-SNE.

Projet de regroupement par K-moyennes — illustration 10

Questions Fréquemment Posées

La leçon « Projet de regroupement par K-moyennes » est-elle gratuite ?

Oui — le texte complet de « Projet de regroupement par K-moyennes » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Python Academy, passe à CoddyKit PRO. Le cours Python Academy comprend 5 leçons au total.

Qu'est-ce que j'apprendrai dans « Projet de regroupement par K-moyennes » ?

Application à un jeu de données réel Tu pratiques Python Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer Python Academy ?

Aucune expérience préalable n'est requise. Python Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 5.

Combien de temps prend la leçon « Projet de regroupement par K-moyennes » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon Python Academy ?

Oui. Chaque leçon Python Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Introduction aux algorithmes de regroupement
  2. Regroupement par K-moyennes
  3. Projet de regroupement par K-moyennes
  4. Notions fondamentales de la réduction dimensionnelle
  5. Application de la réduction dimensionnelle
← Retour à Python Academy