0Pricing
NLP Academy · Aula

Truques de tokenização com expressões regulares

Divida o texto exatamente como deseja.

Truques de tokenização com expressões regulares é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.

Tokenização com padrões

Você pode tokenizar o texto descrevendo a aparência de um token e deixando que a expressão regular encontre cada parte que corresponda à sua definição.

Encontre palavras diretamente

O padrão \w+ com findall captura cada sequência de caracteres de palavra, fornecendo uma lista limpa de palavras e ignorando os espaços entre elas.

re.findall("\w+", "Hello, world!")

Divida em vez de fazer correspondências

A função re.split divide o texto sempre que um padrão aparece. Dividir pelos espaços em branco transforma rapidamente uma frase em uma lista de tokens aproximados.

re.split("\s+", "one  two three")

Divida usando vários separadores

Com uma classe de caracteres, re.split pode dividir usando vários separadores de uma só vez, como espaços, vírgulas e ponto e vírgulas.

re.split("[ ,;]+", "a, b;c d")

Mantenha a pontuação como tokens

Às vezes, a pontuação é importante. Um padrão como \w+|[^\w\s] captura palavras e símbolos isolados separadamente, para que nada seja descartado silenciosamente.

O operador de alternância

O pipe significa ou. O padrão cat|dog corresponde a qualquer uma das palavras, permitindo que uma expressão regular descreva vários formatos de tokens relevantes.

re.findall("cat|dog", "a dog, a cat")

Faça correspondência de números e decimais

Os números precisam de uma regra própria. O padrão \d+\.?\d* corresponde a números inteiros e decimais, mantendo preços e valores juntos em um único token.

re.findall("\d+\.?\d*", "buy 3 for 4.50")

Trate contrações

A divisão ingênua destrói palavras como do not em sua forma abreviada. Um padrão de token mais inteligente pode manter apóstrofos dentro de uma palavra, onde eles pertencem.

Os limites de palavra ajudam

O marcador \b indica um limite de palavra, a fronteira entre uma palavra e algo que não é palavra. Ele ajuda a capturar palavras inteiras sem capturar as vizinhas.

Crie um padrão de token

Um tokenizador prático geralmente combina regras com alternância: corresponde primeiro a URLs, depois a números, palavras e símbolos, nessa ordem de prioridade.

Compile para ganhar velocidade

Se reutilizar muito um padrão, re.compile o transforma em um objeto reutilizável. O código fica mais claro e é executado mais rapidamente em várias strings.

tok = re.compile("\w+")

Verificação rápida

Você quer dividir uma string sempre que aparecerem um ou mais espaços. Qual função é mais adequada?

Recapitulação: tokenizadores com expressões regulares

Você usou findall, split, alternation, and compile para transformar texto bruto exatamente nos tokens desejados. As expressões regulares oferecem controle total. 🎯

Perguntas Frequentes

A aula “Truques de tokenização com expressões regulares” é grátis?

Sim — o texto completo de “Truques de tokenização com expressões regulares” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.

O que vou aprender em “Truques de tokenização com expressões regulares”?

Divida o texto exatamente como deseja. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar NLP Academy?

Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.

Quanto tempo leva a aula “Truques de tokenização com expressões regulares”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de NLP Academy?

Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Expressões regulares em 5 minutos
  2. Encontrando e-mails e URLs
  3. Grupos de captura e substituições
  4. Truques de tokenização com expressões regulares
← Voltar para NLP Academy