0Pricing
NLP Academy · Aula

Por que os modelos precisam de números, não palavras

O salto do texto para os vetores.

Por que os modelos precisam de números, não palavras é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.

Partes desta aula ainda não foram traduzidas e aparecem em inglês.

Machines Speak Numbers

A model cannot do math on the word cat. Every algorithm under the hood only understands numbers, so text must be converted first.

The Core Problem

Your goal is to turn each document into a row of numbers, a vector, that captures what the text contains.

Words Have No Order Value

You cannot say cat is greater than dog. Words are categories, not quantities, so raw text has no numeric meaning to compute on.

From Text to Vectors

This conversion from words into number arrays is called vectorization. It is the bridge between language and machine learning.

Counting Is the Simplest Bridge

The easiest vector is just how many times each word appears. This count-based idea is the heart of bag-of-words. 🛍️

Why Bag Of Words

It is a bag because order is thrown away. You keep which words appear and how often, but not the sequence they came in.

A Tiny Example

Imagine two reviews. We can score each by counting good and bad to get a simple numeric representation of its tone.

docs = ["food was good good", "service was bad"]

Same Length for Every Row

Every document becomes a vector of the same length, one slot per known word, so a model can compare rows directly.

Missing Words Are Zero

If a word never appears in a document, its slot is simply zero. Most slots end up zero, which makes these vectors sparse.

Numbers Unlock Algorithms

Once text is numeric, every classic tool works: distance, similarity, and classifiers all operate on these vectors.

Meaning Is Approximate

Counts ignore grammar and word order, so bag-of-words is a rough but surprisingly strong baseline for many tasks.

Quick Check

Why must text be converted before modeling?

Recap: Text Becomes Numbers

You saw why models need vectors, met bag-of-words, and learned that word counts turn documents into numbers a model can read. 🎉

Perguntas Frequentes

A aula “Por que os modelos precisam de números, não palavras” é grátis?

Sim — o texto completo de “Por que os modelos precisam de números, não palavras” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.

O que vou aprender em “Por que os modelos precisam de números, não palavras”?

O salto do texto para os vetores. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar NLP Academy?

Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.

Quanto tempo leva a aula “Por que os modelos precisam de números, não palavras”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de NLP Academy?

Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Por que os modelos precisam de números, não palavras
  2. Criando um vocabulário
  3. Contando com CountVectorizer
  4. Lendo a matriz documento-termo
← Voltar para NLP Academy