Fréquence des termes et fréquence inverse des documents
Les deux composantes du score
Fréquence des termes et fréquence inverse des documents est une leçon NLP Academy gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage NLP Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours NLP Academy comprend 4 leçons au total.
Les deux moitiés d'un même score
Le TF-IDF est constitué de deux éléments qui se multiplient : la fréquence des termes et la fréquence inverse des documents. Chaque moitié corrige une faiblesse différente des comptages bruts.
La fréquence des termes, simplement
La fréquence des termes mesure combien de fois un mot apparaît dans un document. Un mot mentionné plus souvent indique que le document porte davantage sur ce sujet.
Normaliser la TF
Nous divisons souvent le nombre d'occurrences d'un mot par la longueur du document. Cette normalisation empêche les documents longs de sembler importants simplement parce qu'ils contiennent davantage de mots.
count = 3
doc_length = 50
tf = count / doc_length
print(round(tf, 3))La TF seule ne suffit pas
À elle seule, la fréquence des termes continue de favoriser les mots de remplissage qui apparaissent souvent. Nous avons besoin d'un second facteur pour pénaliser les mots présents partout.
La fréquence des documents
La fréquence des documents compte le nombre de documents qui contiennent un mot, quelle qu'en soit la quantité. Une fréquence des documents élevée signifie que le mot est courant dans toute votre collection.
L'inverser : la fréquence inverse
Nous voulons que les mots rares obtiennent un score élevé, alors nous inversons ce comptage. La fréquence inverse des documents augmente lorsqu'un mot apparaît dans peu de documents et diminue lorsqu'il est présent partout.
Le logarithme adoucit les écarts
L'IDF utilise un logarithme afin que les valeurs n'explosent pas pour les mots très rares. Le log conserve une échelle régulière et comparable entre les termes.
import math
total_docs = 1000
docs_with_word = 10
idf = math.log(total_docs / docs_with_word)
print(round(idf, 3))Les multiplier ensemble
Le score final est simplement la TF multipliée par l'IDF. Un mot ne se démarque que s'il est fréquent ici et rare ailleurs : c'est exactement la combinaison que nous recherchions.
tf = 0.06
idf = 4.6
tfidf = tf * idf
print(round(tfidf, 3))Les mots qui obtiennent un score élevé
Un mot lié au sujet, comme neuroscience dans un article, obtient un score élevé. Un mot comme the est fortement pénalisé, car son IDF est presque nul.
Les mots qui obtiennent un score faible
Les mots présents dans presque tous les documents reçoivent de très faibles pondérations. Le TF-IDF relègue automatiquement ce bruit de fond sans nécessiter de liste manuelle de mots vides.
Pourquoi cela fonctionne si bien
Le TF-IDF équilibre l'importance locale et la rareté globale dans une formule simple. C'est cet équilibre qui a fait de cette pondération un élément incontournable de la recherche et du traitement de texte pendant des décennies. ⭐
Vérification rapide
Que récompense réellement la partie correspondant à la fréquence inverse des documents ?
Récapitulatif
La TF mesure la fréquence locale, l'IDF récompense la rareté globale, et leur produit est le TF-IDF. Ensemble, ils mettent en évidence les mots qui définissent réellement un document. ✅
Apprends Python avec un tuteur IA — gratuit
Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.
- Cours
- 30
- Leçons
- 120
Questions Fréquemment Posées
La leçon « Fréquence des termes et fréquence inverse des documents » est-elle gratuite ?
Oui — le texte complet de « Fréquence des termes et fréquence inverse des documents » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours NLP Academy, passe à CoddyKit PRO. Le cours NLP Academy comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Fréquence des termes et fréquence inverse des documents » ?
Les deux composantes du score Tu pratiques NLP Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer NLP Academy ?
Aucune expérience préalable n'est requise. NLP Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.
Combien de temps prend la leçon « Fréquence des termes et fréquence inverse des documents » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon NLP Academy ?
Oui. Chaque leçon NLP Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Le problème des comptages bruts
- Fréquence des termes et fréquence inverse des documents
- TF-IDF avec scikit-learn
- Trouver les mots les plus importants