0Pricing
Learn AI with Python · Lektion

K-Means-Clustering-Projekt

Anwenden auf einen realen Datensatz

K-Means-Clustering-Projekt ist eine kostenlose Learn AI with Python-Lektion auf CoddyKit. Dies ist Lektion 3 von 5. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Learn AI with Python-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Learn AI with Python-Kurs umfasst insgesamt 5 Lektionen.

K-Means-Clustering-Projekt

K-Means-Clustering-Projekt

In diesem Projekt wenden wir K-Means-Clustering auf einen realen Datensatz zur Kundensegmentierung an. Ziel ist es, Kunden anhand ihrer Ausgabemuster zu gruppieren.

K-Means-Clustering-Projekt — Illustration 1

Datensatzübersicht

Datensatzübersicht

Der Datensatz enthält die folgenden Spalten:

  • Kunden-ID: Eindeutige Kennung für jeden Kunden.
  • Alter: Alter des Kunden.
  • Jahreseinkommen: Jahreseinkommen in Tausend Dollar.
  • Ausgaben-Score: Ein auf Grundlage des Kundenverhaltens und der Ausgabenmuster vergebener Wert (1–100).

Schritt 1: Datensatz und Bibliotheken importieren

Schritt 1: Datensatz und Bibliotheken importieren

Wir beginnen mit dem Importieren der erforderlichen Bibliotheken und dem Laden des Datensatzes:

import pandas as pd
import matplotlib.pyplot as plt
from sklearn.cluster import KMeans

# Load dataset
data = pd.read_csv('Mall_Customers.csv')
print(data.head())

Schritt 2: Datenvorverarbeitung

Schritt 2: Datenvorverarbeitung

Wir wählen relevante Merkmale für das Clustering aus und normalisieren die Daten bei Bedarf. Für dieses Projekt verwenden wir Jahreseinkommen und Ausgabenbewertung:

# Select relevant features
X = data[['Annual Income (k$)', 'Spending Score (1-100)']].values
print(X[:5])

Schritt 3: Die optimale Anzahl von Clustern bestimmen

Schritt 3: Die optimale Anzahl von Clustern bestimmen

Wir verwenden die Ellbogenmethode, um die optimale Anzahl von Clustern zu ermitteln, indem wir die Within-Cluster-Sum-of-Squares (WCSS) für verschiedene Werte von K darstellen:

wcss = []
for i in range(1, 11):
    kmeans = KMeans(n_clusters=i, init='k-means++', random_state=42)
    kmeans.fit(X)
    wcss.append(kmeans.inertia_)

plt.plot(range(1, 11), wcss)
plt.title('Elbow Method')
plt.xlabel('Number of Clusters')
plt.ylabel('WCSS')
plt.show()

Schritt 4: K-Means-Clustering anwenden

Schritt 4: K-Means-Clustering anwenden

Auf Grundlage der Ellbogenmethode wählen wir die optimale Anzahl von Clustern (z. B. K=5) und passen das K-Means-Modell an:

kmeans = KMeans(n_clusters=5, init='k-means++', random_state=42)
kmeans.fit(X)

# Add cluster labels to the dataset
data['Cluster'] = kmeans.labels_
print(data.head())

Schritt 5: Die Cluster visualisieren

Schritt 5: Die Cluster visualisieren

Wir können die Cluster in einem 2D-Raum darstellen, um ihre Trennung zu beobachten:

plt.scatter(X[:, 0], X[:, 1], c=kmeans.labels_, cmap='viridis')
plt.scatter(kmeans.cluster_centers_[:, 0], kmeans.cluster_centers_[:, 1], s=200, c='red', marker='X')
plt.title('Customer Segmentation')
plt.xlabel('Annual Income (k$)')
plt.ylabel('Spending Score (1-100)')
plt.show()

Schritt 6: Cluster interpretieren

Schritt 6: Cluster interpretieren

Jedes Cluster stellt eine Gruppe von Kunden mit ähnlichen Ausgabemustern dar. Zum Beispiel:

  • Cluster 1: Hohes Einkommen, hohe Ausgaben.
  • Cluster 2: Niedriges Einkommen, niedrige Ausgaben.
  • Cluster 3: Mittleres Einkommen, hohe Ausgaben.

Herausforderungen beim Clustering in der Praxis

Herausforderungen beim Clustering in der Praxis

Obwohl Clustering leistungsfähig ist, stehen praktische Anwendungen vor Herausforderungen wie:

  • Hochdimensionale Datensätze.
  • Verrauschte oder unvollständige Daten.
  • Die sinnvolle Interpretation von Clusterergebnissen.

Zusammenfassung und nächste Schritte

Zusammenfassung und nächste Schritte

In diesem Projekt haben wir:

  • einen realen Datensatz untersucht.
  • K-Means-Clustering angewendet und die Ergebnisse visualisiert.
  • die Cluster interpretiert, um das Kundenverhalten zu verstehen.

Als Nächstes lernen wir Verfahren zur Dimensionsreduktion wie PCA und t-SNE kennen.

K-Means-Clustering-Projekt — Illustration 10

Häufig gestellte Fragen

Ist die Lektion „K-Means-Clustering-Projekt“ kostenlos?

Ja — der vollständige Text von „K-Means-Clustering-Projekt“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Learn AI with Python-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Learn AI with Python-Kurs umfasst insgesamt 5 Lektionen.

Was lerne ich in „K-Means-Clustering-Projekt“?

Anwenden auf einen realen Datensatz Du übst Learn AI with Python mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Learn AI with Python zu starten?

Keine Vorkenntnisse erforderlich. Learn AI with Python auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 5.

Wie lange dauert die Lektion „K-Means-Clustering-Projekt“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Learn AI with Python-Lektion Code schreiben und ausführen?

Ja. Jede Learn AI with Python-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Einführung in Clustering-Algorithmen
  2. K-Means-Clustering
  3. K-Means-Clustering-Projekt
  4. Grundlagen der Dimensionsreduktion
  5. Anwendung der Dimensionsreduktion
← Zurück zu Learn AI with Python