Data Science Academy · Lección

Escalar primero y ajustar PCA después

Por qué la estandarización es importante aquí.

Lección 3 de 413 pasos

Escalar primero y ajustar PCA después es una lección gratuita de Data Science Academy en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Data Science Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Data Science Academy incluye 4 lecciones en total.

A PCA le importa la escala

PCA busca la mayor varianza, pero la varianza depende de las unidades. Una característica expresada con números grandes puede dominar solo por su escala.

La trampa de las unidades

Imagine un salario en dólares junto a una edad en años. El salario varía en miles, así que PCA lo consideraría mucho más importante, de forma injusta.

Estandarice primero

La solución es la estandarización: reescalar cada característica para que tenga media cero y varianza unitaria, de modo que todas partan en igualdad de condiciones.

Use StandardScaler

En scikit-learn, StandardScaler centra y escala sus columnas antes de que PCA llegue a procesarlas.

from sklearn.preprocessing import StandardScaler
Xs = StandardScaler().fit_transform(X)

Después, ajuste PCA

Ejecute PCA sobre los datos escalados, nunca sobre los datos sin procesar. Así, cada componente reflejará la estructura real y no unas unidades desproporcionadas.

from sklearn.decomposition import PCA
scores = PCA(n_components=2).fit_transform(Xs)

Centrar también importa

PCA presupone que los datos están centrados en cero. La estandarización lo consigue restando la media de cada columna, de modo que los ejes pasan por el centro de los datos.

Encadénelo en un pipeline

Incluya el escalador y PCA en un Pipeline para que el escalado siempre se realice primero y no haya filtraciones entre las particiones de sus datos.

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), PCA(2))

Ajústelo solo con los datos de entrenamiento

Ajuste el escalador con los datos de entrenamiento y reutilícelo después con los datos de prueba. Ajustarlo con todo filtra información y exagera sus puntuaciones.

Cuándo puede omitirlo

Si todas las características ya comparten la misma unidad y el mismo rango, el escalado es menos importante. Si no está seguro, estandarice de todos modos; rara vez perjudica.

Observe la diferencia

Ejecute PCA con y sin escalado sobre datos con unidades mixtas. La varianza explicada y los componentes principales serán sorprendentemente diferentes.

Existen opciones robustas

Si hay valores atípicos importantes, considere RobustScaler, que utiliza medianas y cuartiles para que los puntos extremos influyan menos en PCA.

from sklearn.preprocessing import RobustScaler

Comprobación rápida

Hay un paso que casi siempre se realiza justo antes de PCA.

Resumen

PCA es sensible a la escala, así que estandarice primero, ajústelo solo con los datos de entrenamiento y use un pipeline para mantener el orden correctamente. 🎯

Gratis para empezar

Aprende Python con un tutor de IA — gratis

Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.

Cursos
30
Lecciones
120

Preguntas frecuentes

¿La lección «Escalar primero y ajustar PCA después» es gratis?

Sí — el texto completo de «Escalar primero y ajustar PCA después» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Data Science Academy, actualiza a CoddyKit PRO. El curso de Data Science Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Escalar primero y ajustar PCA después»?

Por qué la estandarización es importante aquí. Practicas Data Science Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar Data Science Academy?

No se requiere experiencia previa. Data Science Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.

¿Cuánto tiempo toma la lección «Escalar primero y ajustar PCA después»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de Data Science Academy?

Sí. Cada lección de Data Science Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. La maldición de tener demasiadas características
  2. Cómo encuentra componentes PCA
  3. Escalar primero y ajustar PCA después
  4. Elegir componentes con gráficos de sedimentación
← Volver a Data Science Academy