Data Science Academy · Lektion

Spredning: varians og standardafvigelse

Hvor bredt dine data faktisk spreder sig.

Lektion 2 af 413 trin

Spredning: varians og standardafvigelse er en gratis Data Science Academy-lektion på CoddyKit. Dette er lektion 2 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Data Science Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Data Science Academy-kurset indeholder 4 lektioner i alt.

Centrum er ikke nok

To kolonner kan have den samme middelværdi og alligevel se helt forskellige ud. For at skelne dem måler du deres spredning, altså hvor bredt værdierne ligger fordelt. 📏

Afvigelse fra middelværdien

Spredning begynder med hvert punkts afstand fra gennemsnittet, altså dets afvigelse. Små afvigelser betyder tætte data, mens store afvigelser betyder, at dataene er mere spredte.

Hvorfor vi kvadrerer afvigelser

Positive og negative afvigelser ville ophæve hinanden og give nul. Derfor kvadrerer vi først hver afvigelse, så alle afstande bidrager positivt.

Varians defineret

Variansen er gennemsnittet af de kvadrerede afvigelser. En større varians betyder, at værdierne i gennemsnit ligger længere fra middelværdien.

df["price"].var()

Problemet med enhederne

Kvadrering forstørrer også enhederne. Variansen for priser i kroner angives i kroner i anden, hvilket er umuligt at afkode ved første øjekast.

Standardafvigelsen redder dagen

Tag kvadratroden af variansen, så får du standardafvigelsen. Den har samme enhed som dine data, så den giver endelig mening.

df["price"].std()

Sådan læses standardafvigelsen

Standardafvigelsen er omtrent den typiske afstand fra et punkt til middelværdien. En lille std betyder ensartede værdier, mens en stor betyder stor variation.

68-procentsreglen

For data, der omtrent følger en klokkeform, ligger cirka 68 procent af værdierne inden for én standardafvigelse fra middelværdien. Det er et hurtigt tjek af intervallet.

Stikprøve kontra population

pandas dividerer som standard med n minus én, altså stikprøveversionen. Denne lille ændring korrigerer skævhed, når dine data kun er en stikprøve fra en større gruppe.

Spredning gør sammenligning mulig

Standardafvigelsen lader dig sammenligne ensartethed på en fair måde. Det produkt, der har den mindre std for leveringstiden, er det mest pålidelige.

Begge dele på én gang

Du behøver ikke vælge mellem dem manuelt. Resultatet fra describe indeholder allerede std for hver numerisk kolonne, du har.

df.describe().loc["std"]

Hurtigt tjek

Du ønsker et spredningsmål, der bruger de samme enheder som de oprindelige data.

Opsummering: Måling af spredning

Du har lært, at variansen beregner gennemsnittet af kvadrerede afstande, og at standardafvigelsen fører det tilbage til virkelige enheder. Sammen viser de, hvor meget dine data varierer. 🌟

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
30
Lektioner
120

Ofte stillede spørgsmål

Er lektionen “Spredning: varians og standardafvigelse” gratis?

Ja — hele teksten til “Spredning: varians og standardafvigelse” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Data Science Academy-kurset, skal du opgradere til CoddyKit PRO. Data Science Academy-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Spredning: varians og standardafvigelse”?

Hvor bredt dine data faktisk spreder sig. Du øver dig i Data Science Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Data Science Academy?

Der kræves ingen tidligere erfaring. Data Science Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 4.

Hvor lang tid tager lektionen “Spredning: varians og standardafvigelse”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Data Science Academy-lektion?

Ja. Alle Data Science Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Gennemsnit, median og typetal
  2. Spredning: varians og standardafvigelse
  3. Minimum, maksimum og kvartiler
  4. Outliers, og hvad de betyder
← Tilbage til Data Science Academy