Tokenização e normalização
Técnicas de pré-processamento de texto.
Tokenização e normalização é uma aula grátis de Learn AI with Python no CoddyKit. Esta é a aula 2 de 5. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Learn AI with Python, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Learn AI with Python inclui 5 aulas no total.
Noções básicas de pré-processamento de texto
Tokenização e normalização
O pré-processamento de texto é uma etapa essencial do PLN. Ele envolve a transformação de texto bruto em um formato estruturado para análise. As principais etapas de pré-processamento incluem a tokenização e a normalização.

O que é tokenização?
O que é tokenização?
Tokenização é o processo de dividir o texto em unidades menores, chamadas tokens. Os tokens podem ser palavras, frases ou caracteres.
Por exemplo:
Texto: "NLP is amazing!"
Tokens: ["NLP", "is", "amazing", "!"]
Exemplo de tokenização em Python
Exemplo de tokenização em Python
Usando a biblioteca NLTK, podemos tokenizar o texto em palavras ou frases:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)O que é normalização?
O que é normalização?
A normalização envolve limpar e padronizar o texto. As técnicas comuns de normalização incluem:
- Conversão para minúsculas: Converter todo o texto para letras minúsculas.
- Remoção da pontuação: Eliminar os sinais de pontuação.
- Redução ao radical: Reduzir as palavras à sua forma básica, removendo afixos (por exemplo, "running" → "run").
- Lematização: Reduzir as palavras à sua forma básica usando o contexto (por exemplo, "better" → "good").
Conversão para minúsculas e remoção da pontuação
Conversão para minúsculas e remoção da pontuação
Veja como normalizar o texto convertendo-o para letras minúsculas e removendo a pontuação:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)Redução ao radical e lematização
Redução ao radical e lematização
Redução ao radical: Reduz as palavras ao seu radical removendo os sufixos. É baseada em regras e pode não produzir palavras válidas.
Lematização: Usa um vocabulário e regras gramaticais para reduzir as palavras à sua forma básica com significado.
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))Remoção de palavras de parada
Remoção de palavras de parada
Palavras de parada são palavras comuns (por exemplo, "is", "and", "the") que geralmente não carregam um significado relevante. Removê-las pode simplificar a análise de texto:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)Desafios no pré-processamento de texto
Desafios no pré-processamento de texto
O pré-processamento de texto pode ser desafiador devido a:
- Ambiguidade: Palavras como "lead" podem ter vários significados.
- Contexto: A lematização exige compreender o contexto da palavra.
- Variação linguística: Lidar com diferentes idiomas e dialetos.
Resumo e próximos passos
Resumo e próximos passos
Nesta lição, nós:
- Aprendemos sobre tokenização e normalização.
- Exploramos técnicas como redução ao radical, lematização e remoção de palavras de parada.
- Praticamos o pré-processamento de texto com Python.
Em seguida, analisaremos padrões de texto usando modelos de n-gramas.

Perguntas Frequentes
A aula “Tokenização e normalização” é grátis?
Sim — o texto completo de “Tokenização e normalização” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Learn AI with Python, atualize para CoddyKit PRO. O curso de Learn AI with Python inclui 5 aulas no total.
O que vou aprender em “Tokenização e normalização”?
Técnicas de pré-processamento de texto. Você pratica Learn AI with Python com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar Learn AI with Python?
Nenhuma experiência prévia é necessária. Learn AI with Python no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 5.
Quanto tempo leva a aula “Tokenização e normalização”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de Learn AI with Python?
Sim. Cada aula de Learn AI with Python inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Trabalhando com dados textuais
- Tokenização e normalização
- Modelos de N-gramas
- Conceitos de análise de sentimentos
- Modelos baseados em transformadores