0Pricing
Data Science Academy · Lección

Elegir componentes con gráficos de sedimentación

Conservar suficiente varianza explicada.

Elegir componentes con gráficos de sedimentación es una lección gratuita de Data Science Academy en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Data Science Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Data Science Academy incluye 4 lecciones en total.

Partes de esta lección aún no han sido traducidas y se muestran en inglés.

How Many to Keep?

PCA can hand you dozens of components, but you only want the useful few. The real skill is choosing how many to keep.

Meet the Scree Plot

A scree plot charts each component against the variance it explains, so you can see importance drop off at a glance.

Look for the Elbow

Variance falls fast then levels into a flat tail. The bend, called the elbow, marks where extra components stop paying off.

Plot the Ratios

Fit PCA with all components, then plot explained_variance_ratio_ to draw the curve and spot that elbow.

import matplotlib.pyplot as plt
plt.plot(pca.explained_variance_ratio_)

Cumulative Variance

Add the ratios up as you go to get cumulative variance, showing the total information kept by the first k components.

import numpy as np
cum = np.cumsum(pca.explained_variance_ratio_)

Pick a Threshold

A common rule is to keep enough components to reach a target, like 95 percent of total variance retained.

Let scikit-learn Choose

Pass a fraction as n_components and scikit-learn keeps just enough components to hit that explained-variance target.

from sklearn.decomposition import PCA
pca = PCA(n_components=0.95).fit(X)

The Kaiser Rule

Another guide, the Kaiser rule, keeps components whose eigenvalue exceeds one, meaning they explain more than a single feature would.

Balance the Trade-Off

Fewer components mean simpler, faster models but more lost detail. Choosing k is always a trade-off between size and fidelity.

Validate Downstream

The best k is the one that helps your real task. Try a few values and compare model scores with cross-validation.

Beware Tiny Components

Components past the elbow often capture mostly noise. Keeping them rarely helps and can quietly hurt your model.

Quick Check

The scree plot points you to one telltale spot.

Recap

Use a scree plot, elbow, or a cumulative-variance threshold to keep just enough components, then validate k downstream. 🎯

Preguntas frecuentes

¿La lección «Elegir componentes con gráficos de sedimentación» es gratis?

Sí — el texto completo de «Elegir componentes con gráficos de sedimentación» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Data Science Academy, actualiza a CoddyKit PRO. El curso de Data Science Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Elegir componentes con gráficos de sedimentación»?

Conservar suficiente varianza explicada. Practicas Data Science Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar Data Science Academy?

No se requiere experiencia previa. Data Science Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.

¿Cuánto tiempo toma la lección «Elegir componentes con gráficos de sedimentación»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de Data Science Academy?

Sí. Cada lección de Data Science Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. La maldición de tener demasiadas características
  2. Cómo encuentra componentes PCA
  3. Escalar primero y ajustar PCA después
  4. Elegir componentes con gráficos de sedimentación
← Volver a Data Science Academy