Data Science Academy · Lektion

k-Means og valg af k

Albue- og silhuetmetoderne.

Lektion 2 af 413 trin

k-Means og valg af k er en gratis Data Science Academy-lektion på CoddyKit. Dette er lektion 2 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Data Science Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Data Science Academy-kurset indeholder 4 lektioner i alt.

Den foretrukne klyngedanner

k-Means er den mest populære algoritme til klyngedannelse: Den opdeler dine data i k grupper ved at samle punkter omkring centrale ankre. 🎯

Centroider er ankre

Hver klynge har en centroide, altså medlemmernes gennemsnitlige position. Punkter tilslutter sig den klynge, hvis centroide ligger tættest på dem.

Den gentagne proces

k-Means skifter mellem to trin: Tildel hvert punkt til den nærmeste centroide, og genberegn derefter hver centroide ud fra dens nye medlemmer.

Den falder til ro

Trinnene gentages, indtil tildelingerne ikke længere ændrer sig. Algoritmen er konvergeret, og klyngerne er endelige.

Du vælger k først

k-Means kan ikke selv opfinde antallet af grupper. Du skal vælge k på forhånd, og den rigtige værdi er sjældent åbenlys.

Kør det på én linje

scikit-learn gør tilpasningen enkel. Sæt n_clusters til dit valgte k, og kald fit på dine skalerede data.

from sklearn.cluster import KMeans
model = KMeans(n_clusters=3).fit(X)

Inertia måler tæthed

Efter tilpasningen angiver inertia den samlede kvadrerede afstand fra punkterne til deres centroider. En lavere værdi betyder tættere klynger.

model.inertia_

Albue-metoden

Tegn inertia for mange k-værdier. Der, hvor kurven bøjer skarpt, markerer albuen ofte et godt antal klynger.

Aftagende udbytte

Efter albuen sænker flere klynger kun inertia en smule. Denne udfladning viser, at du blot opdeler grupper, der allerede passer godt.

Silhuetscoren

En anden rettesnor er silhuetscoren: Den belønner punkter, der ligger tæt på deres egen klynge og langt fra andre.

from sklearn.metrics import silhouette_score

Start mere intelligent

Tilfældige startpunkter kan give dårlige resultater, så scikit-learn bruger som standard k-means++, der spreder de indledende centroider for at give mere stabile resultater.

Hurtigt tjek

Lad os se, hvordan du ville vælge et fornuftigt k.

Opsummering

k-Means samler punkter omkring centroider for et valgt k. Albuen og silhuetten hjælper dig med at vælge dette k på en god måde. 🎯

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
30
Lektioner
120

Ofte stillede spørgsmål

Er lektionen “k-Means og valg af k” gratis?

Ja — hele teksten til “k-Means og valg af k” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Data Science Academy-kurset, skal du opgradere til CoddyKit PRO. Data Science Academy-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “k-Means og valg af k”?

Albue- og silhuetmetoderne. Du øver dig i Data Science Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Data Science Academy?

Der kræves ingen tidligere erfaring. Data Science Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 4.

Hvor lang tid tager lektionen “k-Means og valg af k”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Data Science Academy-lektion?

Ja. Alle Data Science Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Supervised kontra unsupervised
  2. k-Means og valg af k
  3. Hierarchical og DBSCAN
  4. Profilér og navngiv Deres klynger
← Tilbage til Data Science Academy