0Pricing
Python Academy · Aula

Tokenização e normalização

Técnicas de pré-processamento de texto.

Tokenização e normalização é uma aula grátis de Python Academy no CoddyKit. Esta é a aula 2 de 5. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Python Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Python Academy inclui 5 aulas no total.

Noções básicas de pré-processamento de texto

Tokenização e normalização

O pré-processamento de texto é uma etapa fundamental em PLN. Ele envolve a transformação de texto bruto em um formato estruturado para análise. As principais etapas de pré-processamento incluem tokenização e normalização.

Tokenização e normalização — ilustração 1

O que é tokenização?

O que é tokenização?

Tokenização é o processo de dividir o texto em unidades menores, chamadas tokens. Os tokens podem ser palavras, frases ou caracteres.

Por exemplo:

Texto: "NLP is amazing!"

Tokens: ["NLP", "is", "amazing", "!"]

Exemplo de tokenização em Python

Exemplo de tokenização em Python

Usando a biblioteca NLTK, podemos tokenizar o texto em palavras ou frases:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

O que é normalização?

O que é normalização?

A normalização envolve a limpeza e a padronização do texto. As técnicas comuns de normalização incluem:

  • Conversão para minúsculas: Conversão de todo o texto para letras minúsculas.
  • Remoção de pontuação: Eliminação dos sinais de pontuação.
  • Redução ao radical: Redução das palavras à sua forma radical (por exemplo, "correndo" → "correr").
  • Lematização: Redução das palavras à sua forma básica usando o contexto (por exemplo, "melhor" → "bom").

Conversão para minúsculas e remoção de pontuação

Conversão para minúsculas e remoção de pontuação

Veja como normalizar o texto convertendo-o para letras minúsculas e removendo a pontuação:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

Redução ao radical e lematização

Redução ao radical e lematização

Redução ao radical: Reduz as palavras ao radical, removendo os sufixos. É baseada em regras e pode nem sempre produzir palavras válidas.

Lematização: Usa um vocabulário e regras gramaticais para reduzir as palavras à sua forma básica com significado.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

Remoção de palavras irrelevantes

Remoção de palavras irrelevantes

Palavras irrelevantes são palavras comuns (por exemplo, "é", "e", "o") que geralmente não têm um significado relevante. Removê-las pode simplificar a análise de texto:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

Desafios no pré-processamento de texto

Desafios no pré-processamento de texto

O pré-processamento de texto pode ser desafiador devido a:

  • Ambiguidade: Palavras como "banco" podem ter vários significados.
  • Contexto: A lematização exige a compreensão do contexto da palavra.
  • Variação linguística: Lidar com diferentes idiomas e dialetos.

Resumo e próximos passos

Resumo e próximos passos

Nesta lição, nós:

  • Aprendemos sobre tokenização e normalização.
  • Exploramos técnicas como redução ao radical, lematização e remoção de palavras irrelevantes.
  • Praticamos o pré-processamento de texto com Python.

A seguir, analisaremos padrões de texto usando modelos de N-gramas.

Tokenização e normalização — ilustração 10

Perguntas Frequentes

A aula “Tokenização e normalização” é grátis?

Sim — o texto completo de “Tokenização e normalização” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Python Academy, atualize para CoddyKit PRO. O curso de Python Academy inclui 5 aulas no total.

O que vou aprender em “Tokenização e normalização”?

Técnicas de pré-processamento de texto. Você pratica Python Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar Python Academy?

Nenhuma experiência prévia é necessária. Python Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 5.

Quanto tempo leva a aula “Tokenização e normalização”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de Python Academy?

Sim. Cada aula de Python Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Trabalho com dados textuais
  2. Tokenização e normalização
  3. Modelos de N-gramas
  4. Conceitos de análise de sentimentos
  5. Modelos baseados em transformadores
← Voltar para Python Academy