NLP Academy · Leçon

TF-IDF avec scikit-learn

Vectoriser un corpus en quelques lignes

Leçon 3 sur 413 étapes

TF-IDF avec scikit-learn est une leçon NLP Academy gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage NLP Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours NLP Academy comprend 4 leçons au total.

Inutile de tout coder à la main

Vous comprenez les mathématiques ; laissez donc scikit-learn faire le plus gros du travail. Son TfidfVectorizer transforme des documents bruts en matrice pondérée en quelques lignes.

Importer le vectoriseur

Tout se trouve dans le module feature_extraction.text. Importez TfidfVectorizer et vous pourrez vectoriser n'importe quelle liste de chaînes de texte.

from sklearn.feature_extraction.text import TfidfVectorizer

Votre corpus est une liste

Un corpus est simplement une liste Python de chaînes, une par document. Chaque élément contient le texte intégral que vous souhaitez évaluer et comparer.

corpus = [
    "the cat sat on the mat",
    "the dog chased the cat",
]

Ajuster et transformer

Appelez fit_transform pour apprendre le vocabulaire et calculer le TF-IDF en une seule étape. Cette opération renvoie une matrice creuse de caractéristiques pondérées.

vec = TfidfVectorizer()
X = vec.fit_transform(corpus)
print(X.shape)

Ce que fit a appris

L'étape fit construit le vocabulaire et les valeurs d'IDF à partir de votre corpus. Après cela, le vectoriseur connaît chaque terme et sa rareté.

Examiner le vocabulaire

Vous pouvez lister les noms de caractéristiques appris pour voir les colonnes. get_feature_names_out affiche chaque mot dans l'ordre du vocabulaire. 🔎

print(vec.get_feature_names_out())

La sortie est creuse

La plupart des documents n'utilisent que quelques mots, la matrice est donc composée en grande partie de zéros. scikit-learn la stocke par défaut sous forme de matrice creuse, ce qui économise de la mémoire.

Observer les valeurs réelles

Convertissez une ligne en tableau dense pour lire réellement les pondérations. Les mots de remplissage proches de zéro et les mots liés au sujet se distinguent clairement.

print(X.toarray()[0].round(3))

Ajuster avec des paramètres

Des options pratiques vous permettent d'éliminer instantanément les termes rares ou courants. Définissez min_df et stop_words pour nettoyer le vocabulaire pendant la vectorisation.

vec = TfidfVectorizer(stop_words="english", min_df=2)

Réutiliser sur un nouveau texte

Ajustez une fois le vectoriseur sur les données d'entraînement, puis appelez transform sur de nouveaux documents. Le nouveau texte est associé exactement au même vocabulaire et à la même échelle d'IDF.

new_docs = ["a new cat appeared"]
X_new = vec.transform(new_docs)

Prêt pour un modèle

Cette matrice pondérée s'utilise directement avec n'importe quel classifieur scikit-learn. Les caractéristiques TF-IDF constituent une référence solide et rapide pour les tâches réelles de traitement de texte.

Vérification rapide

Quelle méthode apprend le vocabulaire et calcule la matrice TF-IDF simultanément ?

Récapitulatif

Vous avez importé TfidfVectorizer, l'avez ajusté sur un corpus, examiné la sortie creuse et appris à le réutiliser sur du nouveau texte. Les mathématiques tiennent désormais en une seule ligne. ✅

Gratuit pour commencer

Apprends Python avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
30
Leçons
120

Questions Fréquemment Posées

La leçon « TF-IDF avec scikit-learn » est-elle gratuite ?

Oui — le texte complet de « TF-IDF avec scikit-learn » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours NLP Academy, passe à CoddyKit PRO. Le cours NLP Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « TF-IDF avec scikit-learn » ?

Vectoriser un corpus en quelques lignes Tu pratiques NLP Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer NLP Academy ?

Aucune expérience préalable n'est requise. NLP Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.

Combien de temps prend la leçon « TF-IDF avec scikit-learn » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon NLP Academy ?

Oui. Chaque leçon NLP Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Le problème des comptages bruts
  2. Fréquence des termes et fréquence inverse des documents
  3. TF-IDF avec scikit-learn
  4. Trouver les mots les plus importants
← Retour à NLP Academy