Pipeline completo para dados desbalanceados
Reúna as correções de forma organizada.
Pipeline completo para dados desbalanceados é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.
Junte tudo
Agora você encadeará cada correção em um fluxo organizado. Um único fluxo de processamento mantém a vetorização, a reamostragem e a criação do modelo na ordem correta.
Divida primeiro, sempre
Comece com uma divisão estratificada para que os conjuntos de treinamento e teste mantenham a mesma proporção da classe rara. Isso protege uma avaliação confiável.
X_tr, X_te, y_tr, y_te = train_test_split(X, y, stratify=y)Vetorização do texto
Transforme o texto bruto em números com TF-IDF para que o classificador tenha atributos com os quais aprender.
tfidf = TfidfVectorizer()Reamostragem dentro do fluxo
Use um Pipeline do imblearn para que o SMOTE seja executado somente nas partições de treinamento, sem vazamento para a validação ou o teste.
from imblearn.pipeline import PipelineConecte as etapas
Liste as etapas na ordem: vetorizador, depois SMOTE e, por fim, o modelo. O fluxo de processamento as executa como um único objeto ajustado.
pipe = Pipeline([('tf', tfidf), ('sm', SMOTE()), ('clf', LogisticRegression())])Ajuste uma vez, corretamente
Chame fit em todo o fluxo de processamento. Cada etapa é treinada em sequência usando somente seus dados de treinamento.
pipe.fit(X_tr, y_tr)Avalie da maneira correta
Ignore a exatidão bruta. Um relatório de classificação mostra claramente a precisão, a revocação e o F1 da classe rara.
from sklearn.metrics import classification_report
print(classification_report(y_te, pipe.predict(X_te)))Valide sem vazamentos
Combine o fluxo de processamento com validação cruzada estratificada para que a reamostragem seja refeita dentro de cada partição.
Ajuste o limiar
Obtenha as probabilidades do fluxo de processamento e escolha um limiar que alcance sua revocação desejada nos dados de validação.
proba = pipe.predict_proba(X_te)[:, 1]Salve todo o fluxo de processamento
Persista todo o fluxo de processamento ajustado com joblib para que, mais tarde, a inferência repita cada etapa automaticamente.
import joblib
joblib.dump(pipe, 'model.joblib')Um objeto, resultados reproduzíveis
Como a vetorização, o equilíbrio e a criação do modelo ficam juntos, seus resultados permanecem reproduzíveis e livres de vazamentos sutis. 🚀
Verificação rápida
Mais uma questão sobre fluxos de processamento seguros.
Recapitulação
Estratifique, vetorize, reamostre dentro de um fluxo de processamento, avalie pelo F1 e pela revocação, ajuste o limiar e salve tudo. 🚀
Aprenda Python com um tutor de IA — grátis
Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.
- Cursos
- 30
- Aulas
- 120
Perguntas Frequentes
A aula “Pipeline completo para dados desbalanceados” é grátis?
Sim — o texto completo de “Pipeline completo para dados desbalanceados” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.
O que vou aprender em “Pipeline completo para dados desbalanceados”?
Reúna as correções de forma organizada. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar NLP Academy?
Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.
Quanto tempo leva a aula “Pipeline completo para dados desbalanceados”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de NLP Academy?
Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Por que classes raras são ignoradas
- Reamostragem e pesos de classe
- Escolhendo o limiar e a métrica
- Pipeline completo para dados desbalanceados