Lær AI med Python · leksjon

Beskrivende statistikk og fordelinger

Gjennomsnitt, median, varians, std, skjevhet, kurtose og normal-, binomiske- og Poisson-fordelinger.

Leksjon 1 av 413 trinn

Beskrivende statistikk og fordelinger er en gratis leksjon i Lær AI med Python på CoddyKit. Dette er leksjon 1 av 4. Du kan lese valgfritt 3 leksjoner fra denne læringsstien gratis i sin helhet – deretter låser CoddyKit PRO opp alle leksjoner, samt praktisk øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i Lær AI med Python, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i Lær AI med Python inneholder totalt 4 leksjoner.

Oppsummere data

Deskriptiv statistikk komprimerer et datasett til noen få tall som beskriver sentraltendens, spredning og form. Dette er det første De beregner for ethvert nytt datasett.

import numpy as np
data = np.array([4, 8, 6, 5, 3, 7, 9, 6])

Gjennomsnitt og median

Gjennomsnittet er det aritmetiske gjennomsnittet, mens medianen er den midterste verdien. Medianen påvirkes mindre av uteliggere, så et stort avvik mellom dem tyder på skjevhet.

print(np.mean(data))     # 6.0
print(np.median(data))   # 6.0

Varians og standardavvik

Varians er det gjennomsnittlige kvadrerte avviket fra gjennomsnittet. Standardavvik er kvadratroten av variansen og har samme enhet som dataene.

print(np.var(data))   # population variance
print(np.std(data))   # standard deviation

Utvalg kontra populasjon (ddof)

NumPy deler som standard på N (populasjon). For et estimat basert på et UTVALG deler De på N-1 ved hjelp av ddof=1, noe som korrigerer skjevhet.

print(np.std(data, ddof=0))   # population
print(np.std(data, ddof=1))   # sample (unbiased)

Persentiler og IQR

Persentiler deler sorterte data inn. Persentilene ved 25 og 75 prosent (kvartilene) avgrenser de midterste 50 prosentene, og forskjellen mellom dem er IQR.

q1 = np.percentile(data, 25)
q3 = np.percentile(data, 75)
print(q1, q3, q3 - q1)   # IQR

Skjevhet

Skjevhet måler asymmetri. Positiv skjevhet har en lang hale mot høyre (inntektsdata), mens negativ skjevhet har en lang hale mot venstre. scipy.stats.skew beregner den.

from scipy import stats
print(stats.skew(data))   # near 0 -> symmetric

Kurtose

Kurtose måler hvor tunge halene er. Høy kurtose betyr flere ekstreme uteliggere enn i en normalfordeling. scipy rapporterer overflødig kurtose (normalfordeling = 0).

print(stats.kurtosis(data))   # 0 means normal-like tails

Normalfordelingen

Den klokkeformede normalfordelingen defineres av gjennomsnittet og standardavviket. Omtrent 68 prosent av verdiene ligger innenfor ett standardavvik og 95 prosent innenfor to.

sample = stats.norm.rvs(loc=0, scale=1, size=1000, random_state=0)
print(np.mean(sample), np.std(sample))   # near 0 and 1

Binomisk fordeling

Den binomiske fordelingen teller antall suksesser i n uavhengige ja/nei-forsøk med suksessannsynlighet p, for eksempel antall kron i myntkast.

print(stats.binom.pmf(k=3, n=10, p=0.5))   # P(exactly 3 heads in 10)

Poisson-fordelingen

Poisson-fordelingen modellerer antall sjeldne hendelser i et fast intervall når den gjennomsnittlige raten lambda er kjent, for eksempel antall ankomster per minutt.

print(stats.poisson.pmf(k=2, mu=3))   # P(2 events when avg is 3)

Histogrammer

Et histogram grupperer verdier i intervaller for å vise formen på en fordeling. np.histogram returnerer antall og intervallgrenser, mens matplotlib tegner histogrammet.

counts, edges = np.histogram(sample, bins=10)
print(counts)
# import matplotlib.pyplot as plt; plt.hist(sample, bins=30)

Kort kontroll

Test kunnskapene Deres om deskriptiv statistikk.

Oppsummering

Verktøykasse for deskriptiv statistikk:

  • Sentraltendens: np.mean, np.median
  • Spredning: np.var, np.std (bruk ddof=1 for utvalg), IQR via persentiler
  • Form: scipy.stats.skew, scipy.stats.kurtosis
  • Fordelinger: normal, binomisk og Poisson i scipy.stats
  • Histogrammer for å visualisere form
Gratis å komme i gang

Lær deg Python med en AI-veileder – gratis

Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.

Kurs
53
Leksjoner
225

Ofte stilte spørsmål

Er leksjonen «Beskrivende statistikk og fordelinger» gratis?

Ja – du kan lese valgfritt 3 av leksjonene i læringsstien Lær AI med Python, inkludert «Beskrivende statistikk og fordelinger», gratis i sin helhet her på nettet. Deretter låser CoddyKit PRO opp alle leksjoner, samt interaktiv øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Kurset i Lær AI med Python inneholder totalt 4 leksjoner.

Hva lærer jeg i «Beskrivende statistikk og fordelinger»?

Gjennomsnitt, median, varians, std, skjevhet, kurtose og normal-, binomiske- og Poisson-fordelinger. Du øver på Lær AI med Python med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.

Trenger jeg erfaring for å begynne med Lær AI med Python?

Ingen tidligere erfaring er nødvendig. Lær AI med Python på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 1 av 4.

Hvor lang tid tar leksjonen «Beskrivende statistikk og fordelinger»?

De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.

Kan jeg skrive og kjøre kode i denne Lær AI med Python-leksjonen?

Ja. Alle Lær AI med Python-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.

Alle leksjonene i dette kurset

  1. Beskrivende statistikk og fordelinger
  2. Sannsynlighet og Bayes’ teorem
  3. Hypotesetesting
  4. Korrelasjon og kovarians
← Tilbake til Lær AI med Python