Mit TF-IDF-Merkmalen trainieren
Einen Klassifikator in scikit-learn trainieren
Mit TF-IDF-Merkmalen trainieren ist eine kostenlose NLP Academy-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des NLP Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.
Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.
From Text to Numbers First
A model cannot read raw sentences. You first convert documents into TF-IDF vectors, then train logistic regression on those numbers. 🔢
Fit the Vectorizer
The TfidfVectorizer learns your vocabulary and weighting from the training texts. One call turns a list of strings into a feature matrix.
from sklearn.feature_extraction.text import TfidfVectorizer
vec = TfidfVectorizer()
X = vec.fit_transform(train_texts)Labels Stay Separate
Your features X come from the text, but your labels y come from you. Each document needs its correct class, like spam or not-spam.
Split Before You Train
Hold out a test set so you can judge fairly. train_test_split keeps some data unseen until the very end of evaluation.
from sklearn.model_selection import train_test_split
X_tr, X_te, y_tr, y_te = train_test_split(X, y)Fit Means Learn
Calling fit tells logistic regression to find the word weights that best separate your classes on the training data.
from sklearn.linear_model import LogisticRegression
clf = LogisticRegression(max_iter=1000)
clf.fit(X_tr, y_tr)Raise max_iter If It Warns
Text has many features, so the solver may need more steps. Bumping max_iter clears the common convergence warning you will see.
Predict on New Vectors
To classify fresh text, transform it with the same fitted vectorizer, then call predict. Never refit the vectorizer on test data.
preds = clf.predict(X_te)Transform, Do Not Fit, on Test
Test text uses transform, not fit_transform. Refitting would leak test information and quietly inflate your scores.
Check the Accuracy
A quick score call gives accuracy on the held-out set. It is your first signal that training actually worked.
print(clf.score(X_te, y_te))Same Steps Stay in Sync
Train and prediction must share the exact same vocabulary. Using one fitted vectorizer everywhere keeps feature columns aligned.
A Pipeline Saves You
Wrapping the vectorizer and model in a Pipeline chains transform and predict automatically, so you never forget a step.
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(TfidfVectorizer(), LogisticRegression())Quick Check
How should you prepare test text before predicting?
Recap: Vectorize Then Fit
Vectorize text with TF-IDF, split, then fit logistic regression. Reuse the same vectorizer for test data, ideally inside a pipeline. ✅
Häufig gestellte Fragen
Ist die Lektion „Mit TF-IDF-Merkmalen trainieren“ kostenlos?
Ja — der vollständige Text von „Mit TF-IDF-Merkmalen trainieren“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des NLP Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Mit TF-IDF-Merkmalen trainieren“?
Einen Klassifikator in scikit-learn trainieren Du übst NLP Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um NLP Academy zu starten?
Keine Vorkenntnisse erforderlich. NLP Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.
Wie lange dauert die Lektion „Mit TF-IDF-Merkmalen trainieren“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser NLP Academy-Lektion Code schreiben und ausführen?
Ja. Jede NLP Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Warum logistische Regression bei Texten überzeugt
- Mit TF-IDF-Merkmalen trainieren
- Die stärksten Koeffizienten untersuchen
- Die Stärke der Regularisierung abstimmen