Обучение на признаках TF-IDF
Обучите классификатор в scikit-learn
«Обучение на признаках TF-IDF» — бесплатный урок NLP Academy на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения NLP Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс NLP Academy содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
From Text to Numbers First
A model cannot read raw sentences. You first convert documents into TF-IDF vectors, then train logistic regression on those numbers. 🔢
Fit the Vectorizer
The TfidfVectorizer learns your vocabulary and weighting from the training texts. One call turns a list of strings into a feature matrix.
from sklearn.feature_extraction.text import TfidfVectorizer
vec = TfidfVectorizer()
X = vec.fit_transform(train_texts)Labels Stay Separate
Your features X come from the text, but your labels y come from you. Each document needs its correct class, like spam or not-spam.
Split Before You Train
Hold out a test set so you can judge fairly. train_test_split keeps some data unseen until the very end of evaluation.
from sklearn.model_selection import train_test_split
X_tr, X_te, y_tr, y_te = train_test_split(X, y)Fit Means Learn
Calling fit tells logistic regression to find the word weights that best separate your classes on the training data.
from sklearn.linear_model import LogisticRegression
clf = LogisticRegression(max_iter=1000)
clf.fit(X_tr, y_tr)Raise max_iter If It Warns
Text has many features, so the solver may need more steps. Bumping max_iter clears the common convergence warning you will see.
Predict on New Vectors
To classify fresh text, transform it with the same fitted vectorizer, then call predict. Never refit the vectorizer on test data.
preds = clf.predict(X_te)Transform, Do Not Fit, on Test
Test text uses transform, not fit_transform. Refitting would leak test information and quietly inflate your scores.
Check the Accuracy
A quick score call gives accuracy on the held-out set. It is your first signal that training actually worked.
print(clf.score(X_te, y_te))Same Steps Stay in Sync
Train and prediction must share the exact same vocabulary. Using one fitted vectorizer everywhere keeps feature columns aligned.
A Pipeline Saves You
Wrapping the vectorizer and model in a Pipeline chains transform and predict automatically, so you never forget a step.
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(TfidfVectorizer(), LogisticRegression())Quick Check
How should you prepare test text before predicting?
Recap: Vectorize Then Fit
Vectorize text with TF-IDF, split, then fit logistic regression. Reuse the same vectorizer for test data, ideally inside a pipeline. ✅
Часто задаваемые вопросы
Урок «Обучение на признаках TF-IDF» бесплатный?
Да — полный текст урока «Обучение на признаках TF-IDF» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс NLP Academy, подпишись на CoddyKit PRO. Курс NLP Academy содержит 4 уроков всего.
Чему я научусь в уроке «Обучение на признаках TF-IDF»?
Обучите классификатор в scikit-learn Ты практикуешь NLP Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать NLP Academy?
Предыдущий опыт не требуется. NLP Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.
Сколько времени занимает урок «Обучение на признаках TF-IDF»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке NLP Academy?
Да. Каждый урок NLP Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Почему логистическая регрессия побеждает на текстах
- Обучение на признаках TF-IDF
- Проверка самых сильных коэффициентов
- Настройка силы регуляризации