NLP Academy · Aula

Pipeline completo para dados desbalanceados

Reúna as correções de forma organizada.

Aula 4 de 413 etapas

Pipeline completo para dados desbalanceados é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.

Junte tudo

Agora você encadeará cada correção em um fluxo organizado. Um único fluxo de processamento mantém a vetorização, a reamostragem e a criação do modelo na ordem correta.

Divida primeiro, sempre

Comece com uma divisão estratificada para que os conjuntos de treinamento e teste mantenham a mesma proporção da classe rara. Isso protege uma avaliação confiável.

X_tr, X_te, y_tr, y_te = train_test_split(X, y, stratify=y)

Vetorização do texto

Transforme o texto bruto em números com TF-IDF para que o classificador tenha atributos com os quais aprender.

tfidf = TfidfVectorizer()

Reamostragem dentro do fluxo

Use um Pipeline do imblearn para que o SMOTE seja executado somente nas partições de treinamento, sem vazamento para a validação ou o teste.

from imblearn.pipeline import Pipeline

Conecte as etapas

Liste as etapas na ordem: vetorizador, depois SMOTE e, por fim, o modelo. O fluxo de processamento as executa como um único objeto ajustado.

pipe = Pipeline([('tf', tfidf), ('sm', SMOTE()), ('clf', LogisticRegression())])

Ajuste uma vez, corretamente

Chame fit em todo o fluxo de processamento. Cada etapa é treinada em sequência usando somente seus dados de treinamento.

pipe.fit(X_tr, y_tr)

Avalie da maneira correta

Ignore a exatidão bruta. Um relatório de classificação mostra claramente a precisão, a revocação e o F1 da classe rara.

from sklearn.metrics import classification_report
print(classification_report(y_te, pipe.predict(X_te)))

Valide sem vazamentos

Combine o fluxo de processamento com validação cruzada estratificada para que a reamostragem seja refeita dentro de cada partição.

Ajuste o limiar

Obtenha as probabilidades do fluxo de processamento e escolha um limiar que alcance sua revocação desejada nos dados de validação.

proba = pipe.predict_proba(X_te)[:, 1]

Salve todo o fluxo de processamento

Persista todo o fluxo de processamento ajustado com joblib para que, mais tarde, a inferência repita cada etapa automaticamente.

import joblib
joblib.dump(pipe, 'model.joblib')

Um objeto, resultados reproduzíveis

Como a vetorização, o equilíbrio e a criação do modelo ficam juntos, seus resultados permanecem reproduzíveis e livres de vazamentos sutis. 🚀

Verificação rápida

Mais uma questão sobre fluxos de processamento seguros.

Recapitulação

Estratifique, vetorize, reamostre dentro de um fluxo de processamento, avalie pelo F1 e pela revocação, ajuste o limiar e salve tudo. 🚀

Grátis para começar

Aprenda Python com um tutor de IA — grátis

Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.

Cursos
30
Aulas
120

Perguntas Frequentes

A aula “Pipeline completo para dados desbalanceados” é grátis?

Sim — o texto completo de “Pipeline completo para dados desbalanceados” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.

O que vou aprender em “Pipeline completo para dados desbalanceados”?

Reúna as correções de forma organizada. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar NLP Academy?

Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.

Quanto tempo leva a aula “Pipeline completo para dados desbalanceados”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de NLP Academy?

Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Por que classes raras são ignoradas
  2. Reamostragem e pesos de classe
  3. Escolhendo o limiar e a métrica
  4. Pipeline completo para dados desbalanceados
← Voltar para NLP Academy