Tokenização para modelos Transformer
Subpalavras, preenchimento e máscaras de atenção.
Tokenização para modelos Transformer é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.
Os tokens vêm primeiro
Antes que um transformador possa aprender qualquer coisa, seu texto precisa se tornar números. Essa conversão é responsabilidade do tokenizer.
Combine com o modelo
Sempre carregue o tokenizer que foi treinado com seu modelo. Um vocabulário incompatível produz identificadores sem sentido que o modelo nunca viu.
from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("bert-base-uncased")Partes de subpalavras
Os tokenizers modernos dividem palavras raras em partes menores chamadas subpalavras, para que até textos desconhecidos continuem representáveis.
print(tok.tokenize("tokenization"))Por que as subpalavras vencem
As subpalavras mantêm o vocabulário pequeno e ainda lidam com erros de digitação e palavras novas. O modelo raramente encontra um token realmente desconhecido.
Dos tokens aos identificadores
Cada subpalavra é associada a um identificador inteiro. Chamar o tokenizer com um texto retorna esses identificadores prontos para o modelo.
enc = tok("Fine-tuning is fun")
print(enc["input_ids"])Tokens especiais
Os tokenizers adicionam marcadores como CLS e SEP para que o modelo saiba onde uma sequência começa e termina. Esses são os tokens especiais.
Preenchimento até o mesmo tamanho
Os lotes precisam ter linhas do mesmo tamanho, então textos mais curtos recebem tokens de preenchimento. Esta etapa é chamada de preenchimento.
tok(texts, padding=True)Truncamento para textos longos
Os modelos limitam o tamanho da entrada, então textos muito longos são cortados para caber. Ativar o truncamento mantém cada exemplo dentro do limite.
tok(texts, truncation=True, max_length=128)A máscara de atenção
Uma máscara de atenção marca os tokens reais com 1 e o preenchimento com 0, para que o modelo ignore as posições de preenchimento.
print(enc["attention_mask"])Retornar tensores
Peça ao tokenizer tensores do arcabouço diretamente, para que a saída passe direto ao treinamento sem uma conversão adicional.
tok("hello", return_tensors="pt")Decodificar de volta para texto
Para ler as previsões, passe os identificadores por decode, e o tokenizer reconstruirá o texto original, removendo os tokens especiais.
print(tok.decode(enc["input_ids"]))Verificação rápida
Qual é a função da máscara de atenção durante a formação dos lotes?
Recapitulação
Os tokenizers transformam texto em identificadores de subpalavras, adicionam tokens especiais e depois cuidam do preenchimento, do truncamento e da máscara de atenção para formar lotes adequados. ✅
Aprenda Python com um tutor de IA — grátis
Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.
- Cursos
- 30
- Aulas
- 120
Perguntas Frequentes
A aula “Tokenização para modelos Transformer” é grátis?
Sim — o texto completo de “Tokenização para modelos Transformer” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.
O que vou aprender em “Tokenização para modelos Transformer”?
Subpalavras, preenchimento e máscaras de atenção. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar NLP Academy?
Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.
Quanto tempo leva a aula “Tokenização para modelos Transformer”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de NLP Academy?
Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Visita guiada à biblioteca Transformers
- Tokenização para modelos Transformer
- Ajuste fino com a API Trainer
- Avaliando e salvando seu modelo