K-Means-Clustering-Projekt
Auf einen echten Datensatz anwenden
K-Means-Clustering-Projekt ist eine kostenlose Python Academy-Lektion auf CoddyKit. Dies ist Lektion 3 von 5. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Python Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Python Academy-Kurs umfasst insgesamt 5 Lektionen.
K-Means-Clustering-Projekt
K-Means-Clustering-Projekt
In diesem Projekt wenden wir K-Means-Clustering auf einen realen Datensatz an: die Kundensegmentierung. Ziel ist es, Kunden anhand ihrer Ausgabemuster zu gruppieren.

Übersicht über den Datensatz
Übersicht über den Datensatz
Der Datensatz enthält die folgenden Spalten:
- Kunden-ID: Eindeutige Kennung für jeden Kunden.
- Alter: Alter des Kunden.
- Jahreseinkommen: Jahreseinkommen in Tausend Dollar.
- Ausgabewert: Ein anhand des Kundenverhaltens und der Ausgabemuster zugewiesener Wert (1–100).
Schritt 1: Datensatz und Bibliotheken importieren
Schritt 1: Datensatz und Bibliotheken importieren
Wir beginnen damit, die erforderlichen Bibliotheken zu importieren und den Datensatz zu laden:
import pandas as pd
import matplotlib.pyplot as plt
from sklearn.cluster import KMeans
# Load dataset
data = pd.read_csv('Mall_Customers.csv')
print(data.head())Schritt 2: Datenvorverarbeitung
Schritt 2: Datenvorverarbeitung
Wir wählen relevante Merkmale für das Clustering aus und normalisieren die Daten bei Bedarf. Für dieses Projekt verwenden wir Jahreseinkommen und Ausgabewert:
# Select relevant features
X = data[['Annual Income (k$)', 'Spending Score (1-100)']].values
print(X[:5])Schritt 3: Optimale Clusteranzahl bestimmen
Schritt 3: Optimale Clusteranzahl bestimmen
Wir verwenden die Ellbogenmethode, um die optimale Clusteranzahl zu ermitteln, indem wir die Summe der Quadrate innerhalb der Cluster (WCSS) für verschiedene K-Werte darstellen:
wcss = []
for i in range(1, 11):
kmeans = KMeans(n_clusters=i, init='k-means++', random_state=42)
kmeans.fit(X)
wcss.append(kmeans.inertia_)
plt.plot(range(1, 11), wcss)
plt.title('Elbow Method')
plt.xlabel('Number of Clusters')
plt.ylabel('WCSS')
plt.show()Schritt 4: K-Means-Clustering anwenden
Schritt 4: K-Means-Clustering anwenden
Auf Grundlage der Ellbogenmethode wählen wir die optimale Clusteranzahl (z. B. K=5) und passen das K-Means-Modell an:
kmeans = KMeans(n_clusters=5, init='k-means++', random_state=42)
kmeans.fit(X)
# Add cluster labels to the dataset
data['Cluster'] = kmeans.labels_
print(data.head())Schritt 5: Cluster visualisieren
Schritt 5: Cluster visualisieren
Wir können die Cluster in einem zweidimensionalen Raum darstellen, um ihre Trennung zu beobachten:
plt.scatter(X[:, 0], X[:, 1], c=kmeans.labels_, cmap='viridis')
plt.scatter(kmeans.cluster_centers_[:, 0], kmeans.cluster_centers_[:, 1], s=200, c='red', marker='X')
plt.title('Customer Segmentation')
plt.xlabel('Annual Income (k$)')
plt.ylabel('Spending Score (1-100)')
plt.show()Schritt 6: Cluster interpretieren
Schritt 6: Cluster interpretieren
Jeder Cluster repräsentiert eine Gruppe von Kunden mit ähnlichen Ausgabemustern. Zum Beispiel:
- Cluster 1: Hohes Einkommen, hohe Ausgaben.
- Cluster 2: Niedriges Einkommen, niedrige Ausgaben.
- Cluster 3: Mittleres Einkommen, hohe Ausgaben.
Herausforderungen beim Clustering in der Praxis
Herausforderungen beim Clustering in der Praxis
Obwohl Clustering leistungsfähig ist, stehen Anwendungen in der Praxis vor Herausforderungen wie:
- Hochdimensionale Datensätze.
- Verrauschte oder unvollständige Daten.
- Die sinnvolle Interpretation von Clusterergebnissen.
Zusammenfassung und nächste Schritte
Zusammenfassung und nächste Schritte
In diesem Projekt haben wir:
- Einen realen Datensatz untersucht.
- K-Means-Clustering angewendet und die Ergebnisse visualisiert.
- Die Cluster interpretiert, um das Kundenverhalten zu verstehen.
Als Nächstes lernen wir Verfahren zur Dimensionsreduktion wie PCA und t-SNE kennen.

Häufig gestellte Fragen
Ist die Lektion „K-Means-Clustering-Projekt“ kostenlos?
Ja — der vollständige Text von „K-Means-Clustering-Projekt“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Python Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Python Academy-Kurs umfasst insgesamt 5 Lektionen.
Was lerne ich in „K-Means-Clustering-Projekt“?
Auf einen echten Datensatz anwenden Du übst Python Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um Python Academy zu starten?
Keine Vorkenntnisse erforderlich. Python Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 5.
Wie lange dauert die Lektion „K-Means-Clustering-Projekt“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser Python Academy-Lektion Code schreiben und ausführen?
Ja. Jede Python Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Einführung in Clustering-Algorithmen
- K-Means-Clustering
- K-Means-Clustering-Projekt
- Grundlagen der Dimensionsreduktion
- Anwendung der Dimensionsreduktion