NLP Academy · Leçon

Entraîner le modèle sur des caractéristiques TF-IDF

Ajuster un classifieur dans scikit-learn

Leçon 2 sur 413 étapes

Entraîner le modèle sur des caractéristiques TF-IDF est une leçon NLP Academy gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage NLP Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours NLP Academy comprend 4 leçons au total.

Du texte aux nombres, d'abord

Un modèle ne peut pas lire des phrases brutes. Vous devez d'abord convertir les documents en vecteurs TF-IDF, puis entraîner la régression logistique sur ces nombres. 🔢

Ajustez le vectoriseur

Le TfidfVectorizer apprend votre vocabulaire et les pondérations à partir des textes d'entraînement. Un seul appel transforme une liste de chaînes en matrice de caractéristiques.

from sklearn.feature_extraction.text import TfidfVectorizer
vec = TfidfVectorizer()
X = vec.fit_transform(train_texts)

Les étiquettes restent séparées

Vos caractéristiques X proviennent du texte, mais vos étiquettes y viennent de vous. Chaque document doit avoir sa classe correcte, par exemple spam ou non-spam.

Séparez avant d'entraîner

Mettez de côté un ensemble de test afin de pouvoir évaluer équitablement le modèle. train_test_split conserve certaines données inconnues jusqu'à la toute fin de l'évaluation.

from sklearn.model_selection import train_test_split
X_tr, X_te, y_tr, y_te = train_test_split(X, y)

Ajuster signifie apprendre

L'appel à fit demande à la régression logistique de trouver les poids des mots qui séparent le mieux vos classes dans les données d'entraînement.

from sklearn.linear_model import LogisticRegression
clf = LogisticRegression(max_iter=1000)
clf.fit(X_tr, y_tr)

Augmentez max_iter en cas d'avertissement

Les textes comportent de nombreuses caractéristiques, et le solveur peut donc nécessiter davantage d'étapes. Augmenter max_iter élimine l'avertissement courant de non-convergence que vous verrez.

Prédisez sur de nouveaux vecteurs

Pour classer un nouveau texte, transformez-le avec le même vectoriseur ajusté, puis appelez predict. Ne réajustez jamais le vectoriseur sur les données de test.

preds = clf.predict(X_te)

Transformez, n'ajustez pas, sur le test

Le texte de test utilise transform, et non fit_transform. Un nouvel ajustement ferait fuiter des informations du test et gonflerait discrètement vos scores.

Vérifiez la précision

Un appel rapide à score fournit la précision sur l'ensemble mis de côté. C'est votre premier indice que l'entraînement a réellement fonctionné.

print(clf.score(X_te, y_te))

Les mêmes étapes restent synchronisées

L'entraînement et la prédiction doivent partager exactement le même vocabulaire. Utiliser un seul vectoriseur ajusté partout maintient l'alignement des colonnes de caractéristiques.

Un pipeline vous simplifie la tâche

Regrouper le vectoriseur et le modèle dans un pipeline enchaîne automatiquement la transformation et la prédiction, afin que vous n'oubliiez jamais une étape.

from sklearn.pipeline import make_pipeline
pipe = make_pipeline(TfidfVectorizer(), LogisticRegression())

Vérification rapide

Comment devez-vous préparer le texte de test avant d'effectuer une prédiction ?

Récapitulatif : vectorisez puis ajustez

Vectorisez le texte avec TF-IDF, séparez les données, puis utilisez fit pour ajuster la régression logistique. Réutilisez le même vectoriseur pour les données de test, idéalement dans un pipeline. ✅

Gratuit pour commencer

Apprends Python avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
30
Leçons
120

Questions Fréquemment Posées

La leçon « Entraîner le modèle sur des caractéristiques TF-IDF » est-elle gratuite ?

Oui — le texte complet de « Entraîner le modèle sur des caractéristiques TF-IDF » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours NLP Academy, passe à CoddyKit PRO. Le cours NLP Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Entraîner le modèle sur des caractéristiques TF-IDF » ?

Ajuster un classifieur dans scikit-learn Tu pratiques NLP Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer NLP Academy ?

Aucune expérience préalable n'est requise. NLP Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.

Combien de temps prend la leçon « Entraîner le modèle sur des caractéristiques TF-IDF » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon NLP Academy ?

Oui. Chaque leçon NLP Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Pourquoi la régression logistique fonctionne si bien sur le texte
  2. Entraîner le modèle sur des caractéristiques TF-IDF
  3. Inspecter les coefficients les plus élevés
  4. Régler la force de régularisation
← Retour à NLP Academy