NLP Academy · Aula

Tokenização para modelos Transformer

Subpalavras, preenchimento e máscaras de atenção.

Aula 2 de 413 etapas

Tokenização para modelos Transformer é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.

Os tokens vêm primeiro

Antes que um transformador possa aprender qualquer coisa, seu texto precisa se tornar números. Essa conversão é responsabilidade do tokenizer.

Combine com o modelo

Sempre carregue o tokenizer que foi treinado com seu modelo. Um vocabulário incompatível produz identificadores sem sentido que o modelo nunca viu.

from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("bert-base-uncased")

Partes de subpalavras

Os tokenizers modernos dividem palavras raras em partes menores chamadas subpalavras, para que até textos desconhecidos continuem representáveis.

print(tok.tokenize("tokenization"))

Por que as subpalavras vencem

As subpalavras mantêm o vocabulário pequeno e ainda lidam com erros de digitação e palavras novas. O modelo raramente encontra um token realmente desconhecido.

Dos tokens aos identificadores

Cada subpalavra é associada a um identificador inteiro. Chamar o tokenizer com um texto retorna esses identificadores prontos para o modelo.

enc = tok("Fine-tuning is fun")
print(enc["input_ids"])

Tokens especiais

Os tokenizers adicionam marcadores como CLS e SEP para que o modelo saiba onde uma sequência começa e termina. Esses são os tokens especiais.

Preenchimento até o mesmo tamanho

Os lotes precisam ter linhas do mesmo tamanho, então textos mais curtos recebem tokens de preenchimento. Esta etapa é chamada de preenchimento.

tok(texts, padding=True)

Truncamento para textos longos

Os modelos limitam o tamanho da entrada, então textos muito longos são cortados para caber. Ativar o truncamento mantém cada exemplo dentro do limite.

tok(texts, truncation=True, max_length=128)

A máscara de atenção

Uma máscara de atenção marca os tokens reais com 1 e o preenchimento com 0, para que o modelo ignore as posições de preenchimento.

print(enc["attention_mask"])

Retornar tensores

Peça ao tokenizer tensores do arcabouço diretamente, para que a saída passe direto ao treinamento sem uma conversão adicional.

tok("hello", return_tensors="pt")

Decodificar de volta para texto

Para ler as previsões, passe os identificadores por decode, e o tokenizer reconstruirá o texto original, removendo os tokens especiais.

print(tok.decode(enc["input_ids"]))

Verificação rápida

Qual é a função da máscara de atenção durante a formação dos lotes?

Recapitulação

Os tokenizers transformam texto em identificadores de subpalavras, adicionam tokens especiais e depois cuidam do preenchimento, do truncamento e da máscara de atenção para formar lotes adequados. ✅

Grátis para começar

Aprenda Python com um tutor de IA — grátis

Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.

Cursos
30
Aulas
120

Perguntas Frequentes

A aula “Tokenização para modelos Transformer” é grátis?

Sim — o texto completo de “Tokenização para modelos Transformer” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.

O que vou aprender em “Tokenização para modelos Transformer”?

Subpalavras, preenchimento e máscaras de atenção. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar NLP Academy?

Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.

Quanto tempo leva a aula “Tokenização para modelos Transformer”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de NLP Academy?

Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Visita guiada à biblioteca Transformers
  2. Tokenização para modelos Transformer
  3. Ajuste fino com a API Trainer
  4. Avaliando e salvando seu modelo
← Voltar para NLP Academy