Tokenização e normalização
Técnicas de pré-processamento de texto.
Tokenização e normalização é uma aula grátis de Python Academy no CoddyKit. Esta é a aula 2 de 5. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Python Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Python Academy inclui 5 aulas no total.
Noções básicas de pré-processamento de texto
Tokenização e normalização
O pré-processamento de texto é uma etapa fundamental em PLN. Ele envolve a transformação de texto bruto em um formato estruturado para análise. As principais etapas de pré-processamento incluem tokenização e normalização.

O que é tokenização?
O que é tokenização?
Tokenização é o processo de dividir o texto em unidades menores, chamadas tokens. Os tokens podem ser palavras, frases ou caracteres.
Por exemplo:
Texto: "NLP is amazing!"
Tokens: ["NLP", "is", "amazing", "!"]
Exemplo de tokenização em Python
Exemplo de tokenização em Python
Usando a biblioteca NLTK, podemos tokenizar o texto em palavras ou frases:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)O que é normalização?
O que é normalização?
A normalização envolve a limpeza e a padronização do texto. As técnicas comuns de normalização incluem:
- Conversão para minúsculas: Conversão de todo o texto para letras minúsculas.
- Remoção de pontuação: Eliminação dos sinais de pontuação.
- Redução ao radical: Redução das palavras à sua forma radical (por exemplo, "correndo" → "correr").
- Lematização: Redução das palavras à sua forma básica usando o contexto (por exemplo, "melhor" → "bom").
Conversão para minúsculas e remoção de pontuação
Conversão para minúsculas e remoção de pontuação
Veja como normalizar o texto convertendo-o para letras minúsculas e removendo a pontuação:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)Redução ao radical e lematização
Redução ao radical e lematização
Redução ao radical: Reduz as palavras ao radical, removendo os sufixos. É baseada em regras e pode nem sempre produzir palavras válidas.
Lematização: Usa um vocabulário e regras gramaticais para reduzir as palavras à sua forma básica com significado.
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))Remoção de palavras irrelevantes
Remoção de palavras irrelevantes
Palavras irrelevantes são palavras comuns (por exemplo, "é", "e", "o") que geralmente não têm um significado relevante. Removê-las pode simplificar a análise de texto:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)Desafios no pré-processamento de texto
Desafios no pré-processamento de texto
O pré-processamento de texto pode ser desafiador devido a:
- Ambiguidade: Palavras como "banco" podem ter vários significados.
- Contexto: A lematização exige a compreensão do contexto da palavra.
- Variação linguística: Lidar com diferentes idiomas e dialetos.
Resumo e próximos passos
Resumo e próximos passos
Nesta lição, nós:
- Aprendemos sobre tokenização e normalização.
- Exploramos técnicas como redução ao radical, lematização e remoção de palavras irrelevantes.
- Praticamos o pré-processamento de texto com Python.
A seguir, analisaremos padrões de texto usando modelos de N-gramas.

Perguntas Frequentes
A aula “Tokenização e normalização” é grátis?
Sim — o texto completo de “Tokenização e normalização” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Python Academy, atualize para CoddyKit PRO. O curso de Python Academy inclui 5 aulas no total.
O que vou aprender em “Tokenização e normalização”?
Técnicas de pré-processamento de texto. Você pratica Python Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar Python Academy?
Nenhuma experiência prévia é necessária. Python Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 5.
Quanto tempo leva a aula “Tokenização e normalização”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de Python Academy?
Sim. Cada aula de Python Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Trabalho com dados textuais
- Tokenização e normalização
- Modelos de N-gramas
- Conceitos de análise de sentimentos
- Modelos baseados em transformadores