0Pricing
NLP Academy · Aula

Contando com CountVectorizer

Transforme documentos em uma matriz de contagens.

Contando com CountVectorizer é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.

Partes desta aula ainda não foram traduzidas e aparecem em inglês.

Meet CountVectorizer

The CountVectorizer from scikit-learn builds your vocabulary and counts words for you in just a few lines. 🚀

from sklearn.feature_extraction.text import CountVectorizer

Create the Vectorizer

First make an instance. With no arguments it uses sensible defaults for tokenizing and lowercasing text.

vectorizer = CountVectorizer()

Fit Learns the Vocabulary

Calling fit scans your documents and discovers every unique word, building the vocabulary automatically.

vectorizer.fit(docs)

Transform Produces Counts

Then transform turns each document into its count vector, giving you a numeric matrix of word frequencies.

X = vectorizer.transform(docs)

Fit and Transform Together

The shortcut fit_transform does both steps at once on your training text, which is the common workflow.

X = vectorizer.fit_transform(docs)

See the Vocabulary

Inspect the learned words and their indices with get_feature_names_out. These are your matrix columns.

print(vectorizer.get_feature_names_out())

Output Is a Sparse Matrix

To save memory, the result is a sparse matrix that stores only the non-zero counts, not every zero slot.

Peek at the Numbers

Convert to a dense array to actually read the counts. Use toarray for small examples only.

print(X.toarray())

Lowercasing Is Automatic

By default it lowercases text and splits on word boundaries, so The and the count as the same token.

Built-In Cleaning Options

You can pass stop_words, min_df, or max_features to prune the vocabulary right inside the vectorizer.

CountVectorizer(stop_words="english", max_features=1000)

Reuse on New Text

Never refit on test data. Call only transform so new documents use the exact same vocabulary you trained.

X_new = vectorizer.transform(new_docs)

Quick Check

Which call learns the vocabulary and counts in one step?

Recap: CountVectorizer

You used CountVectorizer to fit a vocabulary, transform text into counts, inspect features, and reuse it on new data. 🎉

Perguntas Frequentes

A aula “Contando com CountVectorizer” é grátis?

Sim — o texto completo de “Contando com CountVectorizer” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.

O que vou aprender em “Contando com CountVectorizer”?

Transforme documentos em uma matriz de contagens. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar NLP Academy?

Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.

Quanto tempo leva a aula “Contando com CountVectorizer”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de NLP Academy?

Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Por que os modelos precisam de números, não palavras
  2. Criando um vocabulário
  3. Contando com CountVectorizer
  4. Lendo a matriz documento-termo
← Voltar para NLP Academy