0Pricing
Data Science Academy · Урок

Выбор компонентов с помощью графиков каменистой осыпи

Сохранение достаточной доли объяснённой дисперсии

«Выбор компонентов с помощью графиков каменистой осыпи» — бесплатный урок Data Science Academy на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Data Science Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Data Science Academy содержит 4 уроков всего.

Части этого урока еще не переведены и отображаются на английском.

How Many to Keep?

PCA can hand you dozens of components, but you only want the useful few. The real skill is choosing how many to keep.

Meet the Scree Plot

A scree plot charts each component against the variance it explains, so you can see importance drop off at a glance.

Look for the Elbow

Variance falls fast then levels into a flat tail. The bend, called the elbow, marks where extra components stop paying off.

Plot the Ratios

Fit PCA with all components, then plot explained_variance_ratio_ to draw the curve and spot that elbow.

import matplotlib.pyplot as plt
plt.plot(pca.explained_variance_ratio_)

Cumulative Variance

Add the ratios up as you go to get cumulative variance, showing the total information kept by the first k components.

import numpy as np
cum = np.cumsum(pca.explained_variance_ratio_)

Pick a Threshold

A common rule is to keep enough components to reach a target, like 95 percent of total variance retained.

Let scikit-learn Choose

Pass a fraction as n_components and scikit-learn keeps just enough components to hit that explained-variance target.

from sklearn.decomposition import PCA
pca = PCA(n_components=0.95).fit(X)

The Kaiser Rule

Another guide, the Kaiser rule, keeps components whose eigenvalue exceeds one, meaning they explain more than a single feature would.

Balance the Trade-Off

Fewer components mean simpler, faster models but more lost detail. Choosing k is always a trade-off between size and fidelity.

Validate Downstream

The best k is the one that helps your real task. Try a few values and compare model scores with cross-validation.

Beware Tiny Components

Components past the elbow often capture mostly noise. Keeping them rarely helps and can quietly hurt your model.

Quick Check

The scree plot points you to one telltale spot.

Recap

Use a scree plot, elbow, or a cumulative-variance threshold to keep just enough components, then validate k downstream. 🎯

Часто задаваемые вопросы

Урок «Выбор компонентов с помощью графиков каменистой осыпи» бесплатный?

Да — полный текст урока «Выбор компонентов с помощью графиков каменистой осыпи» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Data Science Academy, подпишись на CoddyKit PRO. Курс Data Science Academy содержит 4 уроков всего.

Чему я научусь в уроке «Выбор компонентов с помощью графиков каменистой осыпи»?

Сохранение достаточной доли объяснённой дисперсии Ты практикуешь Data Science Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать Data Science Academy?

Предыдущий опыт не требуется. Data Science Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.

Сколько времени занимает урок «Выбор компонентов с помощью графиков каменистой осыпи»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке Data Science Academy?

Да. Каждый урок Data Science Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Проклятие слишком большого числа признаков
  2. Как PCA находит компоненты
  3. Сначала масштабирование, затем PCA
  4. Выбор компонентов с помощью графиков каменистой осыпи
← Назад к Data Science Academy