Treinando com recursos TF-IDF
Ajuste um classificador no scikit-learn.
Treinando com recursos TF-IDF é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.
Primeiro, do texto para números
Um modelo não consegue ler frases brutas. Primeiro, o senhor converte os documentos em vetores TF-IDF e depois treina a regressão logística com esses números. 🔢
Ajuste o vetorizador
O TfidfVectorizer aprende seu vocabulário e seus pesos a partir dos textos de treinamento. Uma chamada transforma uma lista de strings em uma matriz de atributos.
from sklearn.feature_extraction.text import TfidfVectorizer
vec = TfidfVectorizer()
X = vec.fit_transform(train_texts)Os rótulos permanecem separados
Seus atributos X vêm do texto, mas seus rótulos y vêm do senhor. Cada documento precisa ter sua classe correta, como spam ou não spam.
Divida antes de treinar
Separe um conjunto de teste para poder avaliá-lo de maneira justa. train_test_split mantém parte dos dados sem ser vista até o final da avaliação.
from sklearn.model_selection import train_test_split
X_tr, X_te, y_tr, y_te = train_test_split(X, y)Ajustar significa aprender
Chamar fit instrui a regressão logística a encontrar os pesos das palavras que melhor separam suas classes nos dados de treinamento.
from sklearn.linear_model import LogisticRegression
clf = LogisticRegression(max_iter=1000)
clf.fit(X_tr, y_tr)Aumente max_iter se houver um aviso
Textos têm muitos atributos, portanto o solucionador pode precisar de mais etapas. Aumentar max_iter elimina o aviso comum de convergência que o senhor verá.
Faça previsões com novos vetores
Para classificar um texto novo, transforme-o com o mesmo vetorizador ajustado e depois chame predict. Nunca ajuste novamente o vetorizador com dados de teste.
preds = clf.predict(X_te)Transforme, não ajuste, no teste
O texto de teste usa transform, não fit_transform. Ajustá-lo novamente vazaria informações do teste e aumentaria artificialmente suas pontuações.
Verifique a precisão
Uma chamada rápida de score fornece a precisão no conjunto reservado. Esse é o primeiro sinal de que o treinamento realmente funcionou.
print(clf.score(X_te, y_te))As mesmas etapas permanecem sincronizadas
O treinamento e as previsões precisam compartilhar exatamente o mesmo vocabulário. Usar um único vetorizador ajustado em todos os lugares mantém as colunas de atributos alinhadas.
Um fluxo de processamento ajuda o senhor
Colocar o vetorizador e o modelo em um fluxo de processamento encadeia automaticamente a transformação e a previsão, para que o senhor nunca se esqueça de uma etapa.
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(TfidfVectorizer(), LogisticRegression())Verificação rápida
Como o senhor deve preparar o texto de teste antes de fazer previsões?
Recapitulação: vetorize e depois ajuste
Vetorize o texto com TF-IDF, divida os dados e depois use fit na regressão logística. Reutilize o mesmo vetorizador para os dados de teste, de preferência dentro de um fluxo de processamento. ✅
Perguntas Frequentes
A aula “Treinando com recursos TF-IDF” é grátis?
Sim — o texto completo de “Treinando com recursos TF-IDF” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.
O que vou aprender em “Treinando com recursos TF-IDF”?
Ajuste um classificador no scikit-learn. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar NLP Academy?
Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.
Quanto tempo leva a aula “Treinando com recursos TF-IDF”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de NLP Academy?
Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Por que a regressão logística vence em textos
- Treinando com recursos TF-IDF
- Inspecionando os coeficientes mais fortes
- Ajustando a força da regularização