Kuvailevat tilastot ja jakaumat
Keskiarvo, mediaani, varianssi, std, vinous, huipukkuus sekä normaalijakauma, binomijakauma ja Poisson-jakauma.
Kuvailevat tilastot ja jakaumat on ilmainen Oppikaa tekoälyä Pythonilla-oppitunti CoddyKitissä. Tämä on oppitunti 1/4. Voit lukea tästä oppimispolusta kokonaan mitkä tahansa 3 oppituntia ilmaiseksi — sen jälkeen CoddyKit PRO avaa kaikki oppitunnit sekä käytännön harjoittelun sisäänrakennetulla koodieditorilla ja ympäri vuorokauden toimivalla tekoälytuutorilla. Oppitunti kuuluu Oppikaa tekoälyä Pythonilla-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. Oppikaa tekoälyä Pythonilla-kurssilla on yhteensä 4 oppituntia.
Aineiston yhteenveto
Kuvailevat tilastot tiivistävät aineiston muutamaan lukuun, jotka kuvaavat sen keskikohtaa, hajontaa ja muotoa. Ne ovat ensimmäinen asia, joka kannattaa laskea uudesta aineistosta.
import numpy as np
data = np.array([4, 8, 6, 5, 3, 7, 9, 6])Keskiarvo ja mediaani
Keskiarvo on aritmeettinen keskiarvo ja mediaani järjestetyn aineiston keskimmäinen arvo. Mediaani kestää poikkeavia havaintoja, joten niiden suuri ero viittaa jakauman vinouteen.
print(np.mean(data)) # 6.0
print(np.median(data)) # 6.0Varianssi ja keskihajonta
Varianssi on keskimääräinen neliöity poikkeama keskiarvosta, ja keskihajonta on sen neliöjuuri eli aineiston kanssa samoissa yksiköissä ilmoitettu suure.
print(np.var(data)) # population variance
print(np.std(data)) # standard deviationOtos ja perusjoukko (ddof)
NumPy jakaa oletusarvoisesti N:llä (perusjoukon tapauksessa). OTOSarvion tapauksessa jakakaa N-1:llä käyttämällä asetusta ddof=1, joka korjaa harhaa.
print(np.std(data, ddof=0)) # population
print(np.std(data, ddof=1)) # sample (unbiased)Prosenttipisteet ja IQR
Prosenttipisteet jakavat järjestetyn aineiston osiin. 25. ja 75. prosenttipisteet (kvartiilit) rajaavat keskimmäiset 50 prosenttia, ja niiden erotus on IQR.
q1 = np.percentile(data, 25)
q3 = np.percentile(data, 75)
print(q1, q3, q3 - q1) # IQRVinous
Vinous mittaa epäsymmetriaa. Positiivisesti vino jakauma ulottuu pitkänä oikealle (kuten tulot), negatiivisesti vino pitkänä vasemmalle. scipy.stats.skew laskee vinouden.
from scipy import stats
print(stats.skew(data)) # near 0 -> symmetricHuipukkuus
Huipukkuus mittaa jakauman häntien raskautta. Suuri huipukkuus tarkoittaa normaalikäyrää enemmän äärimmäisiä poikkeamia. scipy ilmoittaa ylikurtosisarvon (normaalijakauma = 0).
print(stats.kurtosis(data)) # 0 means normal-like tailsNormaalijakauma
Kellokäyrän muotoinen normaalijakauma määritellään keskiarvon ja keskihajonnan avulla. Noin 68 prosenttia arvoista osuu yhden keskihajonnan ja 95 prosenttia kahden keskihajonnan sisään.
sample = stats.norm.rvs(loc=0, scale=1, size=1000, random_state=0)
print(np.mean(sample), np.std(sample)) # near 0 and 1Binomijakauma
Binomijakauma laskee onnistumisten määrän n toisistaan riippumattomassa kyllä–ei-kokeessa, jossa onnistumisen todennäköisyys on p, kuten kruunujen määrän kolikonheitoissa.
print(stats.binom.pmf(k=3, n=10, p=0.5)) # P(exactly 3 heads in 10)Poisson-jakauma
Poisson-jakauma mallintaa harvinaisten tapahtumien määrää tietyllä aikavälillä, kun keskimääräinen tapahtumataajuus lambda tunnetaan, kuten saapumisten määrää minuutissa.
print(stats.poisson.pmf(k=2, mu=3)) # P(2 events when avg is 3)Histogrammit
Histogrammi jakaa arvot luokkiin jakauman muodon paljastamiseksi. np.histogram palauttaa määrät ja luokkarajat, ja matplotlib piirtää histogrammin.
counts, edges = np.histogram(sample, bins=10)
print(counts)
# import matplotlib.pyplot as plt; plt.hist(sample, bins=30)Pikatarkistus
Testatkaa kuvailevia tilastoja koskevat tietonne.
Kertaus
Kuvailevien tilastojen työkalupakki:
- Keskikohta:
np.mean,np.median - Hajonta:
np.var,np.std(käyttäkää otoksille asetustaddof=1) sekä prosenttipisteistä laskettava IQR - Muoto:
scipy.stats.skew,scipy.stats.kurtosis - Jakaumat: normaali-, binomi- ja Poisson-jakauma paketissa
scipy.stats - Histogrammit muodon havainnollistamiseen
Opi Python tekoälytuutorin avulla — ilmaiseksi
Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.
- Kurssit
- 53
- Oppitunnit
- 225
Usein kysytyt kysymykset
Onko oppitunti ”Kuvailevat tilastot ja jakaumat” ilmainen?
Kyllä — voit lukea täällä verkossa kokonaan ilmaiseksi mitkä tahansa Oppikaa tekoälyä Pythonilla-oppimispolun 3 oppituntia, myös oppitunnin “Kuvailevat tilastot ja jakaumat”. Sen jälkeen CoddyKit PRO avaa kaikki oppitunnit sekä interaktiiviset harjoitukset sisäänrakennetulla koodieditorilla ja ympäri vuorokauden toimivalla tekoälytuutorilla. Oppikaa tekoälyä Pythonilla-kurssilla on yhteensä 4 oppituntia.
Mitä opin oppitunnilla ”Kuvailevat tilastot ja jakaumat”?
Keskiarvo, mediaani, varianssi, std, vinous, huipukkuus sekä normaalijakauma, binomijakauma ja Poisson-jakauma. Harjoittelet Oppikaa tekoälyä Pythonilla-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.
Tarvitsenko kokemusta aloittaakseni Oppikaa tekoälyä Pythonilla-opiskelun?
Aiempi kokemus ei ole tarpeen. CoddyKitin Oppikaa tekoälyä Pythonilla-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 1/4.
Kuinka kauan ”Kuvailevat tilastot ja jakaumat”-oppitunnin suorittaminen kestää?
Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.
Voinko kirjoittaa ja suorittaa koodia tällä Oppikaa tekoälyä Pythonilla-oppitunnilla?
Kyllä. Jokainen Oppikaa tekoälyä Pythonilla-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.
Kaikki tämän kurssin oppitunnit
- Kuvailevat tilastot ja jakaumat
- Todennäköisyys ja Bayesin teoreema
- Hypoteesien testaus
- Korrelaatio ja kovarianssi