0Pricing
Learn AI with Python · Aula

Tokenização e normalização

Técnicas de pré-processamento de texto.

Tokenização e normalização é uma aula grátis de Learn AI with Python no CoddyKit. Esta é a aula 2 de 5. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Learn AI with Python, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Learn AI with Python inclui 5 aulas no total.

Noções básicas de pré-processamento de texto

Tokenização e normalização

O pré-processamento de texto é uma etapa essencial do PLN. Ele envolve a transformação de texto bruto em um formato estruturado para análise. As principais etapas de pré-processamento incluem a tokenização e a normalização.

Tokenização e normalização — ilustração 1

O que é tokenização?

O que é tokenização?

Tokenização é o processo de dividir o texto em unidades menores, chamadas tokens. Os tokens podem ser palavras, frases ou caracteres.

Por exemplo:

Texto: "NLP is amazing!"

Tokens: ["NLP", "is", "amazing", "!"]

Exemplo de tokenização em Python

Exemplo de tokenização em Python

Usando a biblioteca NLTK, podemos tokenizar o texto em palavras ou frases:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

O que é normalização?

O que é normalização?

A normalização envolve limpar e padronizar o texto. As técnicas comuns de normalização incluem:

  • Conversão para minúsculas: Converter todo o texto para letras minúsculas.
  • Remoção da pontuação: Eliminar os sinais de pontuação.
  • Redução ao radical: Reduzir as palavras à sua forma básica, removendo afixos (por exemplo, "running" → "run").
  • Lematização: Reduzir as palavras à sua forma básica usando o contexto (por exemplo, "better" → "good").

Conversão para minúsculas e remoção da pontuação

Conversão para minúsculas e remoção da pontuação

Veja como normalizar o texto convertendo-o para letras minúsculas e removendo a pontuação:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

Redução ao radical e lematização

Redução ao radical e lematização

Redução ao radical: Reduz as palavras ao seu radical removendo os sufixos. É baseada em regras e pode não produzir palavras válidas.

Lematização: Usa um vocabulário e regras gramaticais para reduzir as palavras à sua forma básica com significado.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

Remoção de palavras de parada

Remoção de palavras de parada

Palavras de parada são palavras comuns (por exemplo, "is", "and", "the") que geralmente não carregam um significado relevante. Removê-las pode simplificar a análise de texto:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

Desafios no pré-processamento de texto

Desafios no pré-processamento de texto

O pré-processamento de texto pode ser desafiador devido a:

  • Ambiguidade: Palavras como "lead" podem ter vários significados.
  • Contexto: A lematização exige compreender o contexto da palavra.
  • Variação linguística: Lidar com diferentes idiomas e dialetos.

Resumo e próximos passos

Resumo e próximos passos

Nesta lição, nós:

  • Aprendemos sobre tokenização e normalização.
  • Exploramos técnicas como redução ao radical, lematização e remoção de palavras de parada.
  • Praticamos o pré-processamento de texto com Python.

Em seguida, analisaremos padrões de texto usando modelos de n-gramas.

Tokenização e normalização — ilustração 10

Perguntas Frequentes

A aula “Tokenização e normalização” é grátis?

Sim — o texto completo de “Tokenização e normalização” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Learn AI with Python, atualize para CoddyKit PRO. O curso de Learn AI with Python inclui 5 aulas no total.

O que vou aprender em “Tokenização e normalização”?

Técnicas de pré-processamento de texto. Você pratica Learn AI with Python com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar Learn AI with Python?

Nenhuma experiência prévia é necessária. Learn AI with Python no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 5.

Quanto tempo leva a aula “Tokenização e normalização”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de Learn AI with Python?

Sim. Cada aula de Learn AI with Python inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Trabalhando com dados textuais
  2. Tokenização e normalização
  3. Modelos de N-gramas
  4. Conceitos de análise de sentimentos
  5. Modelos baseados em transformadores
← Voltar para Learn AI with Python