Подсчёт с помощью CountVectorizer
Преобразуйте документы в матрицу подсчётов
«Подсчёт с помощью CountVectorizer» — бесплатный урок NLP Academy на CoddyKit. Это урок 3 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения NLP Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс NLP Academy содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
Meet CountVectorizer
The CountVectorizer from scikit-learn builds your vocabulary and counts words for you in just a few lines. 🚀
from sklearn.feature_extraction.text import CountVectorizerCreate the Vectorizer
First make an instance. With no arguments it uses sensible defaults for tokenizing and lowercasing text.
vectorizer = CountVectorizer()Fit Learns the Vocabulary
Calling fit scans your documents and discovers every unique word, building the vocabulary automatically.
vectorizer.fit(docs)Transform Produces Counts
Then transform turns each document into its count vector, giving you a numeric matrix of word frequencies.
X = vectorizer.transform(docs)Fit and Transform Together
The shortcut fit_transform does both steps at once on your training text, which is the common workflow.
X = vectorizer.fit_transform(docs)See the Vocabulary
Inspect the learned words and their indices with get_feature_names_out. These are your matrix columns.
print(vectorizer.get_feature_names_out())Output Is a Sparse Matrix
To save memory, the result is a sparse matrix that stores only the non-zero counts, not every zero slot.
Peek at the Numbers
Convert to a dense array to actually read the counts. Use toarray for small examples only.
print(X.toarray())Lowercasing Is Automatic
By default it lowercases text and splits on word boundaries, so The and the count as the same token.
Built-In Cleaning Options
You can pass stop_words, min_df, or max_features to prune the vocabulary right inside the vectorizer.
CountVectorizer(stop_words="english", max_features=1000)Reuse on New Text
Never refit on test data. Call only transform so new documents use the exact same vocabulary you trained.
X_new = vectorizer.transform(new_docs)Quick Check
Which call learns the vocabulary and counts in one step?
Recap: CountVectorizer
You used CountVectorizer to fit a vocabulary, transform text into counts, inspect features, and reuse it on new data. 🎉
Часто задаваемые вопросы
Урок «Подсчёт с помощью CountVectorizer» бесплатный?
Да — полный текст урока «Подсчёт с помощью CountVectorizer» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс NLP Academy, подпишись на CoddyKit PRO. Курс NLP Academy содержит 4 уроков всего.
Чему я научусь в уроке «Подсчёт с помощью CountVectorizer»?
Преобразуйте документы в матрицу подсчётов Ты практикуешь NLP Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать NLP Academy?
Предыдущий опыт не требуется. NLP Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 3 из 4.
Сколько времени занимает урок «Подсчёт с помощью CountVectorizer»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке NLP Academy?
Да. Каждый урок NLP Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Почему моделям нужны числа, а не слова
- Создание словаря
- Подсчёт с помощью CountVectorizer
- Чтение матрицы «документы—термы»