0Pricing
Learn AI with Python · Aula

Construindo pipelines de pré-processamento

Pipeline do sklearn, ColumnTransformer e combinação de transformadores para fluxos de pré-processamento organizados.

Construindo pipelines de pré-processamento é uma aula grátis de Learn AI with Python no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Learn AI with Python, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Learn AI with Python inclui 4 aulas no total.

Por que usar fluxos de processamento?

Um Pipeline do scikit-learn encadeia etapas de pré-processamento e um modelo em um único objeto. Ele garante que as mesmas transformações sejam aplicadas aos dados de treinamento e de teste, evitando vazamento e código desorganizado.

Um fluxo de processamento básico

Pipeline recebe uma lista de tuplas (nome, etapa). Chamar fit executa cada etapa em ordem; a etapa final geralmente é um estimador.

from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression

pipe = Pipeline([
    ("scale", StandardScaler()),
    ("model", LogisticRegression()),
])

fit e predict em todo o fluxo de processamento

Trate o fluxo de processamento como um único modelo. fit aprende o escalador AND treina o modelo; predict aplica o escalador e depois o modelo, de forma automática e consistente.

pipe.fit(X_train, y_train)
preds = pipe.predict(X_test)   # scaling applied automatically

Sem vazamento por projeto

Como o fluxo de processamento ajusta o escalador somente durante fit (nos dados de treinamento) e apenas transforma os dados durante predict, ele elimina automaticamente o erro de ajustar com dados de teste.

Tipos de colunas mistos

Conjuntos de dados reais combinam colunas NUMERIC e CATEGORICAL que precisam de pré-processamentos diferentes. ColumnTransformer aplica um transformador diferente a cada subconjunto de colunas.

ColumnTransformer

Forneça tuplas de (nome, transformador, colunas). As colunas numéricas são dimensionadas; as colunas categóricas recebem uma coluna binária por categoria, tudo em uma única etapa.

from sklearn.compose import ColumnTransformer
from sklearn.preprocessing import OneHotEncoder

pre = ColumnTransformer([
    ("num", StandardScaler(), ["age", "income"]),
    ("cat", OneHotEncoder(handle_unknown="ignore"), ["city"]),
])

Aninhando em um fluxo de processamento completo

Coloque o ColumnTransformer como a primeira etapa de um Pipeline, seguido pelo modelo, para obter um fluxo de trabalho completo e sem vazamento.

full = Pipeline([
    ("prep", pre),
    ("model", LogisticRegression()),
])
full.fit(X_train, y_train)

Lidando com valores ausentes em uma etapa

Adicione um SimpleImputer ao ramo numérico (geralmente dentro de um pequeno fluxo de processamento) para preencher os valores ausentes antes do dimensionamento, mantendo tudo dentro do fluxo de processamento.

from sklearn.impute import SimpleImputer
num_pipe = Pipeline([
    ("impute", SimpleImputer(strategy="median")),
    ("scale", StandardScaler()),
])

fit_transform no treinamento, transform no teste

A mesma regra de ouro se aplica ao fluxo de processamento inteiro: ele aprende todos os parâmetros a partir dos dados de treinamento durante fit e depois apenas transforma os dados de teste durante predict ou transform.

full.fit(X_train, y_train)        # learns imputer, scaler, encoder, model
full.predict(X_test)              # transform-only path

Persistindo um fluxo de processamento

Salve em disco o fluxo de processamento inteiro já ajustado, incluindo o pré-processamento e o modelo, com joblib. Ao carregá-lo posteriormente, o pré-processamento idêntico será aplicado em produção, sem etapas manuais para reproduzi-lo.

import joblib
joblib.dump(full, "model.joblib")
loaded = joblib.load("model.joblib")
loaded.predict(X_new)   # same preprocessing guaranteed

Por que isso importa em produção

Um fluxo de processamento persistido significa que o modelo implantado pré-processa os dados recebidos EXACTLY como durante o treinamento. Essa consistência é a maior defesa contra falhas de divergência entre treinamento e disponibilização.

Verificação rápida

Teste seus conhecimentos sobre fluxos de processamento.

Recapitulação

Kit de ferramentas de fluxos de processamento:

  • Pipeline encadeia o pré-processamento e o modelo em um único objeto de ajuste e previsão
  • Sem vazamento: os parâmetros são aprendidos em fit e aplicados em predict
  • ColumnTransformer lida com colunas numéricas e categóricas mistas
  • SimpleImputer para valores ausentes dentro do fluxo de processamento
  • Persista com joblib para manter o pré-processamento consistente em produção

Perguntas Frequentes

A aula “Construindo pipelines de pré-processamento” é grátis?

Sim — o texto completo de “Construindo pipelines de pré-processamento” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Learn AI with Python, atualize para CoddyKit PRO. O curso de Learn AI with Python inclui 4 aulas no total.

O que vou aprender em “Construindo pipelines de pré-processamento”?

Pipeline do sklearn, ColumnTransformer e combinação de transformadores para fluxos de pré-processamento organizados. Você pratica Learn AI with Python com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar Learn AI with Python?

Nenhuma experiência prévia é necessária. Learn AI with Python no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.

Quanto tempo leva a aula “Construindo pipelines de pré-processamento”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de Learn AI with Python?

Sim. Cada aula de Learn AI with Python inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Detecção e remoção de valores discrepantes
  2. Codificação de variáveis categóricas
  3. Escalonamento de atributos: normalização e padronização
  4. Construindo pipelines de pré-processamento
← Voltar para Learn AI with Python