Data Science Academy · レッスン

PCAが成分を見つける仕組み

分散の方向を直感的に理解する

レッスン 2/413 ステップ

「PCAが成分を見つける仕組み」はCoddyKit上の無料Data Science Academyレッスンです。 これはレッスン2/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはData Science Academy学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 Data Science Academyコースには全4レッスンが含まれています。

分散は情報である

PCAは、データが最も広がっている方向に最も多くの情報が含まれるという考えから始まります。この広がりをvarianceと呼びます。

最大の広がりを見つける

PCAは、データ点の変動が最も大きい1本の軸を探します。その方向がfirst principal componentになります。

次は垂直方向へ

次の軸は、最初の軸と直角をなしながら、残った広がりを最大限に捉える必要があります。新しい各成分は他の成分に対してorthogonalです。

成分は新しい軸

これらの方向を組み合わせると、新しい座標系ができます。それぞれのprincipal componentは元の特徴量を組み合わせたものであり、単一の列ではありません。

重要度の順に並ぶ

PCAは各成分が捉える分散の大きさに基づいて成分を並べます。そのため、最初の数個が信号の大部分を保持し、最後の数個は主にノイズを保持します。

成分に射影する

データを小さくするには、上位の成分にprojectします。これにより、多くの元の列を少数の有益なスコアに置き換えられます。

説明分散比

explained variance ratioは、各成分が全体の広がりのうちどの程度を保持しているかを示します。これにより、どれだけ削減できたかを確認できます。

scikit-learnでfitする

scikit-learnでは、使用する成分数を設定し、fit_transformで列の多い表をコンパクトなスコアに変換します。

from sklearn.decomposition import PCA
scores = PCA(n_components=2).fit_transform(X)

比率を確認する

fitの後、explained_variance_ratio_を確認すると、各成分がどれだけ保持したかが分かります。合計すると、保持されたvarianceの総量になります。

pca = PCA(n_components=2).fit(X)
print(pca.explained_variance_ratio_)

成分は線形である

各成分は特徴量の重み付き和なので、PCAが捉えられるのはlinearな構造だけです。曲線的なパターンには別の手法が必要です。

圧縮であって魔法ではない

列を大幅に減らす代わりに、多少の精度を犠牲にします。削除される成分は分散が最も小さいため、通常lossはわずかです。

クイックチェック

PCAが最初に選ぶ方向は、1つのルールで決まります。

まとめ

PCAは分散が最大となる直交軸を見つけて順位付けし、上位の軸にデータを射影して圧縮します。🎯

無料で開始

AI チューターと学ぶ Python — 無料

ブラウザでリアルコードを書いて実行し、24/7 の AI チューターから瞬時にサポートを受け、ウェブまたはアプリで続きから学習できます。

コース
30
レッスン
120

よくある質問

「PCAが成分を見つける仕組み」レッスンは無料ですか?

はい。「PCAが成分を見つける仕組み」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、Data Science Academyコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 Data Science Academyコースには全4レッスンが含まれています。

「PCAが成分を見つける仕組み」で何を学びますか?

分散の方向を直感的に理解する ブラウザで直接実行するハンズオンコードでData Science Academyを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。

Data Science Academyを始めるのに経験は必要ですか?

事前経験は必要ありません。CoddyKitのData Science Academyは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン2/4です。

「PCAが成分を見つける仕組み」レッスンにはどのくらい時間がかかりますか?

ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。

このData Science Academyレッスンでコードを書いて実行できますか?

はい。すべてのData Science Academyレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。

このコースのすべてのレッスン

  1. 特徴量が多すぎる問題
  2. PCAが成分を見つける仕組み
  3. まずスケーリングしてからPCAを適用する
  4. スクリープロットで成分を選ぶ
← Data Science Academyに戻る