Atenção multicabeças e posições
Várias perspectivas e consciência da ordem.
Atenção multicabeças e posições é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.
Uma cabeça é limitante
Uma única cabeça de atenção consegue acompanhar apenas um tipo de relação por vez. A linguagem real exige que muitos padrões sejam percebidos ao mesmo tempo. 🧠
Muitas cabeças, muitas perspectivas
A atenção com múltiplas cabeças executa vários cálculos de atenção em paralelo, cada um com suas próprias projeções aprendidas e seu próprio foco.
O que cada cabeça aprende
Uma cabeça pode acompanhar relações entre sujeito e verbo, enquanto outra acompanha pronomes. Juntas, elas capturam uma visão muito mais rica da frase.
Divida as dimensões
O modelo divide o tamanho do vetor entre as cabeças, portanto cada cabeça trabalha em um subespaço menor. O custo computacional total permanece aproximadamente igual.
d_head = d_model // num_headsCombine as cabeças
Depois que cada cabeça produz uma saída, você as concatena e passa o resultado por mais uma camada linear para combinar as perspectivas.
out = concat(head_1, head_2, ...) @ W_oA atenção ignora a ordem
A autoatenção trata a entrada como um conjunto; portanto, sozinha, não consegue distinguir "dog bites man" de "man bites dog". Ela é indiferente à ordem.
Adicionando informações de posição
Para corrigir isso, inserimos uma codificação posicional em cada palavra, para que o modelo saiba onde cada token está na sequência.
Codificações senoidais
O Transformer original usa ondas fixas de seno e cosseno, com frequências diferentes, para dar a cada posição uma assinatura única e suave.
pe[pos, 2i] = sin(pos / 10000 ** (2*i/d))Adicionadas, não anexadas
Os vetores de posição são adicionados às representações vetoriais das palavras, e não colocados no final. Assim, cada token carrega seu significado e sua posição juntos.
x = token_embeddings + positional_encodingPosições aprendidas também
Muitos modelos modernos substituem as ondas fixas por representações vetoriais de posição aprendidas, treinadas junto com todo o restante para oferecer mais flexibilidade.
Por que ambas são importantes
A atenção com múltiplas cabeças identifica muitas relações; as codificações posicionais restauram a ordem. Juntas, elas permitem que o Transformer realmente compreenda sequências. ✨
Verificação rápida
Vamos testar as posições e as cabeças.
Recapitulação
Você viu como a atenção com múltiplas cabeças captura muitas relações em paralelo, enquanto as codificações posicionais dão ao modelo uma noção de ordem. 🎯
Aprenda Python com um tutor de IA — grátis
Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.
- Cursos
- 30
- Aulas
- 120
Perguntas Frequentes
A aula “Atenção multicabeças e posições” é grátis?
Sim — o texto completo de “Atenção multicabeças e posições” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.
O que vou aprender em “Atenção multicabeças e posições”?
Várias perspectivas e consciência da ordem. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar NLP Academy?
Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.
Quanto tempo leva a aula “Atenção multicabeças e posições”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de NLP Academy?
Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- A ideia de atenção
- Autoatenção, passo a passo
- Atenção multicabeças e posições
- Por dentro do bloco Transformer