0Pricing
Data Science Academy · Lektion

k-Means und die Wahl von k

Elbow- und Silhouettenmethode

k-Means und die Wahl von k ist eine kostenlose Data Science Academy-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Data Science Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Data Science Academy-Kurs umfasst insgesamt 4 Lektionen.

Der bevorzugte Clusterer

k-Means ist der beliebteste Clustering-Algorithmus: Er teilt Ihre Daten in k Gruppen auf, indem er Punkte um zentrale Anker gruppiert. 🎯

Zentroiden sind Anker

Jeder Cluster hat einen Zentroiden, also die mittlere Position seiner Mitglieder. Punkte werden dem Cluster zugeordnet, dessen Zentroid ihnen am nächsten liegt.

Der wiederkehrende Ablauf

k-Means wechselt zwischen zwei Schritten: Zuerst wird jeder Punkt dem nächstgelegenen Zentroiden zugeordnet, dann wird jeder Zentroid anhand seiner neuen Mitglieder neu berechnet.

Es stabilisiert sich

Diese Schritte werden wiederholt, bis sich die Zuordnungen nicht mehr ändern. Der Algorithmus ist konvergiert und die Cluster stehen fest.

Sie wählen k zuerst

k-Means kann die Anzahl der Gruppen nicht selbst ermitteln. Sie müssen k im Voraus festlegen, und der richtige Wert ist selten offensichtlich.

In einer Zeile ausführen

scikit-learn macht das Training einfach. Setzen Sie n_clusters auf das von Ihnen gewählte k und rufen Sie fit mit Ihren skalierten Daten auf.

from sklearn.cluster import KMeans
model = KMeans(n_clusters=3).fit(X)

Inertia misst die Kompaktheit

Nach dem Training gibt inertia die Summe der quadrierten Distanzen von den Punkten zu ihren Zentroiden an. Ein niedrigerer Wert bedeutet kompaktere Cluster.

model.inertia_

Die Ellbogenmethode

Tragen Sie die Trägheit für viele k-Werte auf. Wo sich die Kurve stark krümmt, am Ellbogen, liegt oft eine gute Anzahl von Clustern.

Abnehmender Grenznutzen

Hinter dem Ellbogen senkt das Hinzufügen weiterer Cluster die Trägheit kaum noch. Diese Abflachung zeigt, dass Sie nur noch Gruppen aufteilen, die bereits gut zusammenpassen.

Der Silhouettenkoeffizient

Ein zweiter Anhaltspunkt ist der Silhouettenkoeffizient: Er belohnt Punkte, die nahe an ihrem eigenen Cluster und weit von anderen entfernt liegen.

from sklearn.metrics import silhouette_score

Cleverer starten

Zufällige Starts können ungünstig ausfallen. Deshalb verwendet scikit-learn standardmäßig k-means++, das die initialen Zentroiden mit größerem Abstand verteilt und so stabilere Ergebnisse liefert.

Kurze Überprüfung

Überprüfen wir, wie Sie ein sinnvolles k auswählen würden.

Zusammenfassung

k-Means gruppiert Punkte für ein gewähltes k um Zentroiden; der Ellbogen und der Silhouettenkoeffizient helfen Ihnen dabei, dieses k sinnvoll zu wählen. 🎯

Häufig gestellte Fragen

Ist die Lektion „k-Means und die Wahl von k“ kostenlos?

Ja — der vollständige Text von „k-Means und die Wahl von k“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Data Science Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Data Science Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „k-Means und die Wahl von k“?

Elbow- und Silhouettenmethode Du übst Data Science Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Data Science Academy zu starten?

Keine Vorkenntnisse erforderlich. Data Science Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.

Wie lange dauert die Lektion „k-Means und die Wahl von k“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Data Science Academy-Lektion Code schreiben und ausführen?

Ja. Jede Data Science Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Überwachtes und unüberwachtes Lernen
  2. k-Means und die Wahl von k
  3. Hierarchisches Clustering und DBSCAN
  4. Ihre Cluster profilieren und benennen
← Zurück zu Data Science Academy