Por dentro do bloco Transformer
Como toda a arquitetura se encaixa.
Por dentro do bloco Transformer é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.
Empilhando blocos
Um Transformer é construído empilhando o mesmo bloco várias vezes. Cada bloco aprimora um pouco mais a representação. 🧱
Duas subcamadas principais
Cada bloco tem duas partes: uma subcamada de atenção com múltiplas cabeças, seguida por uma pequena rede de alimentação direta aplicada a cada posição.
A rede de alimentação direta
A subcamada de alimentação direta consiste em duas camadas lineares com uma não linearidade entre elas, processando cada token de forma independente para obter mais capacidade.
h = relu(x @ W1 + b1) @ W2 + b2Conexões residuais
Cada subcamada envolve sua entrada em uma conexão residual: adiciona a entrada novamente à saída para que os gradientes fluam e nada seja perdido.
out = x + sublayer(x)Normalização de camadas
Depois de adicionar a conexão residual, a normalização de camadas redimensiona os valores. Isso mantém as ativações estáveis e acelera o treinamento.
out = layer_norm(x + sublayer(x))Blocos do codificador
Uma pilha de codificador lê a entrada e constrói vetores ricos em contexto. Ela usa autoatenção para que cada token veja todos os demais.
Blocos do decodificador
Um decodificador gera a saída um token por vez. Ele adiciona atenção mascarada e atenção cruzada de volta ao codificador.
Atenção mascarada
Durante a geração, o mascaramento oculta os tokens futuros para que o decodificador não possa olhar adiante e tenha de prever honestamente a próxima palavra.
Atenção cruzada
A atenção cruzada permite que o decodificador consulte as saídas do codificador, conectando o que ele está escrevendo ao que leu originalmente.
Profundidade traz poder
Empilhar muitos blocos permite que as camadas iniciais capturem padrões simples e que as camadas posteriores construam significado abstrato, assim como ocorre em redes profundas de visão computacional.
Codificador, decodificador ou ambos
BERT usa apenas o codificador, GPT usa apenas o decodificador e os modelos de tradução usam ambos. O bloco é a unidade de construção compartilhada. 🚀
Verificação rápida
Vamos verificar a estrutura do bloco.
Recapitulação
Você montou o bloco do Transformer: atenção e alimentação direta, envolvidas por conexões residuais e normalização de camadas, empilhadas em codificadores e decodificadores. ✨
Aprenda Python com um tutor de IA — grátis
Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.
- Cursos
- 30
- Aulas
- 120
Perguntas Frequentes
A aula “Por dentro do bloco Transformer” é grátis?
Sim — o texto completo de “Por dentro do bloco Transformer” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.
O que vou aprender em “Por dentro do bloco Transformer”?
Como toda a arquitetura se encaixa. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar NLP Academy?
Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.
Quanto tempo leva a aula “Por dentro do bloco Transformer”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de NLP Academy?
Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- A ideia de atenção
- Autoatenção, passo a passo
- Atenção multicabeças e posições
- Por dentro do bloco Transformer