Spredning: varians og standardafvigelse
Hvor bredt dine data faktisk spreder sig.
Spredning: varians og standardafvigelse er en gratis Data Science Academy-lektion på CoddyKit. Dette er lektion 2 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Data Science Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Data Science Academy-kurset indeholder 4 lektioner i alt.
Centrum er ikke nok
To kolonner kan have den samme middelværdi og alligevel se helt forskellige ud. For at skelne dem måler du deres spredning, altså hvor bredt værdierne ligger fordelt. 📏
Afvigelse fra middelværdien
Spredning begynder med hvert punkts afstand fra gennemsnittet, altså dets afvigelse. Små afvigelser betyder tætte data, mens store afvigelser betyder, at dataene er mere spredte.
Hvorfor vi kvadrerer afvigelser
Positive og negative afvigelser ville ophæve hinanden og give nul. Derfor kvadrerer vi først hver afvigelse, så alle afstande bidrager positivt.
Varians defineret
Variansen er gennemsnittet af de kvadrerede afvigelser. En større varians betyder, at værdierne i gennemsnit ligger længere fra middelværdien.
df["price"].var()Problemet med enhederne
Kvadrering forstørrer også enhederne. Variansen for priser i kroner angives i kroner i anden, hvilket er umuligt at afkode ved første øjekast.
Standardafvigelsen redder dagen
Tag kvadratroden af variansen, så får du standardafvigelsen. Den har samme enhed som dine data, så den giver endelig mening.
df["price"].std()Sådan læses standardafvigelsen
Standardafvigelsen er omtrent den typiske afstand fra et punkt til middelværdien. En lille std betyder ensartede værdier, mens en stor betyder stor variation.
68-procentsreglen
For data, der omtrent følger en klokkeform, ligger cirka 68 procent af værdierne inden for én standardafvigelse fra middelværdien. Det er et hurtigt tjek af intervallet.
Stikprøve kontra population
pandas dividerer som standard med n minus én, altså stikprøveversionen. Denne lille ændring korrigerer skævhed, når dine data kun er en stikprøve fra en større gruppe.
Spredning gør sammenligning mulig
Standardafvigelsen lader dig sammenligne ensartethed på en fair måde. Det produkt, der har den mindre std for leveringstiden, er det mest pålidelige.
Begge dele på én gang
Du behøver ikke vælge mellem dem manuelt. Resultatet fra describe indeholder allerede std for hver numerisk kolonne, du har.
df.describe().loc["std"]Hurtigt tjek
Du ønsker et spredningsmål, der bruger de samme enheder som de oprindelige data.
Opsummering: Måling af spredning
Du har lært, at variansen beregner gennemsnittet af kvadrerede afstande, og at standardafvigelsen fører det tilbage til virkelige enheder. Sammen viser de, hvor meget dine data varierer. 🌟
Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 30
- Lektioner
- 120
Ofte stillede spørgsmål
Er lektionen “Spredning: varians og standardafvigelse” gratis?
Ja — hele teksten til “Spredning: varians og standardafvigelse” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Data Science Academy-kurset, skal du opgradere til CoddyKit PRO. Data Science Academy-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “Spredning: varians og standardafvigelse”?
Hvor bredt dine data faktisk spreder sig. Du øver dig i Data Science Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Data Science Academy?
Der kræves ingen tidligere erfaring. Data Science Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 4.
Hvor lang tid tager lektionen “Spredning: varians og standardafvigelse”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Data Science Academy-lektion?
Ja. Alle Data Science Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- Gennemsnit, median og typetal
- Spredning: varians og standardafvigelse
- Minimum, maksimum og kvartiler
- Outliers, og hvad de betyder