Dimensionar primeiro e ajustar o PCA depois
Por que a padronização é importante aqui.
Dimensionar primeiro e ajustar o PCA depois é uma aula grátis de Data Science Academy no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Data Science Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Data Science Academy inclui 4 aulas no total.
O PCA depende da escala
O PCA busca a maior variância, mas a variância depende das unidades. Um atributo com números grandes pode dominar apenas por causa da sua escala.
Uma armadilha das unidades
Imagine o salário em dólares ao lado da idade em anos. O salário varia na casa dos milhares, então o PCA o trataria como muito mais importante, de forma injusta.
Padronize primeiro
A solução é a padronização: redimensionar cada atributo para média zero e variância unitária, fazendo com que todos comecem em condições iguais.
Use o StandardScaler
No scikit-learn, o StandardScaler centraliza e redimensiona suas colunas antes que o PCA as receba.
from sklearn.preprocessing import StandardScaler
Xs = StandardScaler().fit_transform(X)Depois, ajuste o PCA
Execute o PCA nos dados redimensionados, nunca nos dados brutos. Agora cada componente refletirá a estrutura real, não unidades desproporcionais.
from sklearn.decomposition import PCA
scores = PCA(n_components=2).fit_transform(Xs)A centralização também importa
O PCA pressupõe que os dados estejam centralizados em zero. A padronização faz isso subtraindo a média de cada coluna, para que os eixos passem pelo centro dos dados.
Encadeie tudo em uma pipeline
Envolva o escalonador e o PCA em uma pipeline para que o redimensionamento sempre aconteça primeiro e nunca haja vazamento entre as divisões dos dados.
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(StandardScaler(), PCA(2))Ajuste apenas com os dados de treinamento
Ajuste o escalonador com os dados de treinamento e depois reutilize-o nos dados de teste. Ajustá-lo com todos os dados causa vazamento de informação e aumenta artificialmente suas pontuações.
Quando você pode ignorá-lo
Se todos os atributos já usarem a mesma unidade e o mesmo intervalo, o redimensionamento será menos importante. Em caso de dúvida, padronize mesmo assim; isso raramente prejudica.
Observe a diferença
Execute o PCA com e sem redimensionamento em dados com unidades diferentes. A variância explicada e os componentes principais serão bastante diferentes.
Existem opções robustas
Na presença de valores discrepantes fortes, considere o RobustScaler, que usa medianas e quartis para que os pontos extremos influenciem menos o PCA.
from sklearn.preprocessing import RobustScalerVerificação rápida
Uma etapa quase sempre vem imediatamente antes do PCA.
Recapitulação
O PCA é sensível à escala; portanto, padronize primeiro, ajuste apenas com os dados de treinamento e use uma pipeline para manter a ordem correta. 🎯
Aprenda Python com um tutor de IA — grátis
Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.
- Cursos
- 30
- Aulas
- 120
Perguntas Frequentes
A aula “Dimensionar primeiro e ajustar o PCA depois” é grátis?
Sim — o texto completo de “Dimensionar primeiro e ajustar o PCA depois” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Data Science Academy, atualize para CoddyKit PRO. O curso de Data Science Academy inclui 4 aulas no total.
O que vou aprender em “Dimensionar primeiro e ajustar o PCA depois”?
Por que a padronização é importante aqui. Você pratica Data Science Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar Data Science Academy?
Nenhuma experiência prévia é necessária. Data Science Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.
Quanto tempo leva a aula “Dimensionar primeiro e ajustar o PCA depois”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de Data Science Academy?
Sim. Cada aula de Data Science Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- A maldição de recursos demais
- Como o PCA encontra componentes
- Dimensionar primeiro e ajustar o PCA depois
- Escolher componentes com gráficos scree