0Pricing
NLP Academy · Leçon

Compter avec CountVectorizer

Transformer les documents en matrice de comptage

Compter avec CountVectorizer est une leçon NLP Academy gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage NLP Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours NLP Academy comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

Meet CountVectorizer

The CountVectorizer from scikit-learn builds your vocabulary and counts words for you in just a few lines. 🚀

from sklearn.feature_extraction.text import CountVectorizer

Create the Vectorizer

First make an instance. With no arguments it uses sensible defaults for tokenizing and lowercasing text.

vectorizer = CountVectorizer()

Fit Learns the Vocabulary

Calling fit scans your documents and discovers every unique word, building the vocabulary automatically.

vectorizer.fit(docs)

Transform Produces Counts

Then transform turns each document into its count vector, giving you a numeric matrix of word frequencies.

X = vectorizer.transform(docs)

Fit and Transform Together

The shortcut fit_transform does both steps at once on your training text, which is the common workflow.

X = vectorizer.fit_transform(docs)

See the Vocabulary

Inspect the learned words and their indices with get_feature_names_out. These are your matrix columns.

print(vectorizer.get_feature_names_out())

Output Is a Sparse Matrix

To save memory, the result is a sparse matrix that stores only the non-zero counts, not every zero slot.

Peek at the Numbers

Convert to a dense array to actually read the counts. Use toarray for small examples only.

print(X.toarray())

Lowercasing Is Automatic

By default it lowercases text and splits on word boundaries, so The and the count as the same token.

Built-In Cleaning Options

You can pass stop_words, min_df, or max_features to prune the vocabulary right inside the vectorizer.

CountVectorizer(stop_words="english", max_features=1000)

Reuse on New Text

Never refit on test data. Call only transform so new documents use the exact same vocabulary you trained.

X_new = vectorizer.transform(new_docs)

Quick Check

Which call learns the vocabulary and counts in one step?

Recap: CountVectorizer

You used CountVectorizer to fit a vocabulary, transform text into counts, inspect features, and reuse it on new data. 🎉

Questions Fréquemment Posées

La leçon « Compter avec CountVectorizer » est-elle gratuite ?

Oui — le texte complet de « Compter avec CountVectorizer » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours NLP Academy, passe à CoddyKit PRO. Le cours NLP Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Compter avec CountVectorizer » ?

Transformer les documents en matrice de comptage Tu pratiques NLP Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer NLP Academy ?

Aucune expérience préalable n'est requise. NLP Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.

Combien de temps prend la leçon « Compter avec CountVectorizer » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon NLP Academy ?

Oui. Chaque leçon NLP Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Pourquoi les modèles ont besoin de nombres, pas de mots
  2. Créer un vocabulaire
  3. Compter avec CountVectorizer
  4. Lire la matrice document-terme
← Retour à NLP Academy