Data Science Academy · Aula

Dimensionar primeiro e ajustar o PCA depois

Por que a padronização é importante aqui.

Aula 3 de 413 etapas

Dimensionar primeiro e ajustar o PCA depois é uma aula grátis de Data Science Academy no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Data Science Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Data Science Academy inclui 4 aulas no total.

O PCA depende da escala

O PCA busca a maior variância, mas a variância depende das unidades. Um atributo com números grandes pode dominar apenas por causa da sua escala.

Uma armadilha das unidades

Imagine o salário em dólares ao lado da idade em anos. O salário varia na casa dos milhares, então o PCA o trataria como muito mais importante, de forma injusta.

Padronize primeiro

A solução é a padronização: redimensionar cada atributo para média zero e variância unitária, fazendo com que todos comecem em condições iguais.

Use o StandardScaler

No scikit-learn, o StandardScaler centraliza e redimensiona suas colunas antes que o PCA as receba.

from sklearn.preprocessing import StandardScaler
Xs = StandardScaler().fit_transform(X)

Depois, ajuste o PCA

Execute o PCA nos dados redimensionados, nunca nos dados brutos. Agora cada componente refletirá a estrutura real, não unidades desproporcionais.

from sklearn.decomposition import PCA
scores = PCA(n_components=2).fit_transform(Xs)

A centralização também importa

O PCA pressupõe que os dados estejam centralizados em zero. A padronização faz isso subtraindo a média de cada coluna, para que os eixos passem pelo centro dos dados.

Encadeie tudo em uma pipeline

Envolva o escalonador e o PCA em uma pipeline para que o redimensionamento sempre aconteça primeiro e nunca haja vazamento entre as divisões dos dados.

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), PCA(2))

Ajuste apenas com os dados de treinamento

Ajuste o escalonador com os dados de treinamento e depois reutilize-o nos dados de teste. Ajustá-lo com todos os dados causa vazamento de informação e aumenta artificialmente suas pontuações.

Quando você pode ignorá-lo

Se todos os atributos já usarem a mesma unidade e o mesmo intervalo, o redimensionamento será menos importante. Em caso de dúvida, padronize mesmo assim; isso raramente prejudica.

Observe a diferença

Execute o PCA com e sem redimensionamento em dados com unidades diferentes. A variância explicada e os componentes principais serão bastante diferentes.

Existem opções robustas

Na presença de valores discrepantes fortes, considere o RobustScaler, que usa medianas e quartis para que os pontos extremos influenciem menos o PCA.

from sklearn.preprocessing import RobustScaler

Verificação rápida

Uma etapa quase sempre vem imediatamente antes do PCA.

Recapitulação

O PCA é sensível à escala; portanto, padronize primeiro, ajuste apenas com os dados de treinamento e use uma pipeline para manter a ordem correta. 🎯

Grátis para começar

Aprenda Python com um tutor de IA — grátis

Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.

Cursos
30
Aulas
120

Perguntas Frequentes

A aula “Dimensionar primeiro e ajustar o PCA depois” é grátis?

Sim — o texto completo de “Dimensionar primeiro e ajustar o PCA depois” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Data Science Academy, atualize para CoddyKit PRO. O curso de Data Science Academy inclui 4 aulas no total.

O que vou aprender em “Dimensionar primeiro e ajustar o PCA depois”?

Por que a padronização é importante aqui. Você pratica Data Science Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar Data Science Academy?

Nenhuma experiência prévia é necessária. Data Science Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.

Quanto tempo leva a aula “Dimensionar primeiro e ajustar o PCA depois”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de Data Science Academy?

Sim. Cada aula de Data Science Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. A maldição de recursos demais
  2. Como o PCA encontra componentes
  3. Dimensionar primeiro e ajustar o PCA depois
  4. Escolher componentes com gráficos scree
← Voltar para Data Science Academy