0Pricing
Learn AI with Python · レッスン

記述統計と分布

平均、中央値、分散、std、歪度、尖度、正規・二項・ポアソン分布を学びます。

「記述統計と分布」はCoddyKit上の無料Learn AI with Pythonレッスンです。 これはレッスン1/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはLearn AI with Python学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 Learn AI with Pythonコースには全4レッスンが含まれています。

データの要約

記述統計は、データセットの中心、ばらつき、分布の形状を表す少数の数値にデータを要約します。新しいデータセットを扱うとき、まず最初に計算するものです。

import numpy as np
data = np.array([4, 8, 6, 5, 3, 7, 9, 6])

平均と中央値

平均値は算術平均であり、中央値は中央の値です。中央値は外れ値の影響を受けにくいため、両者に大きな差がある場合は、分布の歪みが示唆されます。

print(np.mean(data))     # 6.0
print(np.median(data))   # 6.0

分散と標準偏差

分散は平均値からの偏差を二乗したものの平均であり、標準偏差はその平方根です。標準偏差の単位はデータと同じになります。

print(np.var(data))   # population variance
print(np.std(data))   # standard deviation

標本と母集団(ddof)

NumPyはデフォルトでN(母集団のサイズ)で割ります。標本から推定する場合は、ddof=1を使ってN-1で割ります。これにより偏りを補正できます。

print(np.std(data, ddof=0))   # population
print(np.std(data, ddof=1))   # sample (unbiased)

パーセンタイルとIQR

パーセンタイルは、ソートしたデータを分割する値です。25パーセンタイルと75パーセンタイル(四分位数)で中央50パーセントの範囲を定め、その差がIQRです。

q1 = np.percentile(data, 25)
q3 = np.percentile(data, 75)
print(q1, q3, q3 - q1)   # IQR

歪度

歪度は分布の非対称性を測定します。正の歪度では右側の裾が長く(所得データなど)、負の歪度では左側の裾が長くなります。scipy.stats.skewで計算できます。

from scipy import stats
print(stats.skew(data))   # near 0 -> symmetric

尖度

尖度は裾の重さを測定します。尖度が高いほど、正規分布よりも極端な外れ値が多いことを意味します。scipyは超過尖度を報告し、正規分布は0になります。

print(stats.kurtosis(data))   # 0 means normal-like tails

正規分布

釣鐘型の正規分布は、平均値と標準偏差で定義されます。値のおよそ68パーセントが標準偏差1つ分以内に、95パーセントが2つ分以内に収まります。

sample = stats.norm.rvs(loc=0, scale=1, size=1000, random_state=0)
print(np.mean(sample), np.std(sample))   # near 0 and 1

二項分布

二項分布は、成功確率pの独立したn回の yes/no 試行における成功回数を表します。コイン投げで表が出る回数などが例です。

print(stats.binom.pmf(k=3, n=10, p=0.5))   # P(exactly 3 heads in 10)

ポアソン分布

ポアソン分布は、平均発生率lambdaが与えられた固定区間内で、まれな事象が発生する回数をモデル化します。1分あたりの到着数などが例です。

print(stats.poisson.pmf(k=2, mu=3))   # P(2 events when avg is 3)

ヒストグラム

ヒストグラムは値を区間に分け、分布の形状を明らかにします。np.histogramは度数とビンの境界を返し、matplotlibで描画できます。

counts, edges = np.histogram(sample, bins=10)
print(counts)
# import matplotlib.pyplot as plt; plt.hist(sample, bins=30)

理解度チェック

記述統計に関する知識を確認しましょう。

まとめ

記述統計のツールキット:

  • 中心:np.mean、np.median
  • ばらつき:np.var、np.std(標本にはddof=1を使用)、パーセンタイルによるIQR
  • 形状:scipy.stats.skew、scipy.stats.kurtosis
  • 分布:scipy.statsの正規分布、二項分布、ポアソン分布
  • 形状の可視化にはヒストグラムを使います

よくある質問

「記述統計と分布」レッスンは無料ですか?

はい。「記述統計と分布」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、Learn AI with Pythonコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 Learn AI with Pythonコースには全4レッスンが含まれています。

「記述統計と分布」で何を学びますか?

平均、中央値、分散、std、歪度、尖度、正規・二項・ポアソン分布を学びます。 ブラウザで直接実行するハンズオンコードでLearn AI with Pythonを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。

Learn AI with Pythonを始めるのに経験は必要ですか?

事前経験は必要ありません。CoddyKitのLearn AI with Pythonは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン1/4です。

「記述統計と分布」レッスンにはどのくらい時間がかかりますか?

ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。

このLearn AI with Pythonレッスンでコードを書いて実行できますか?

はい。すべてのLearn AI with Pythonレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。

このコースのすべてのレッスン

  1. 記述統計と分布
  2. 確率とベイズの定理
  3. 仮説検定
  4. 相関と共分散
← Learn AI with Pythonに戻る