NLP Academy · Aula

Atenção multicabeças e posições

Várias perspectivas e consciência da ordem.

Aula 3 de 413 etapas

Atenção multicabeças e posições é uma aula grátis de NLP Academy no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de NLP Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de NLP Academy inclui 4 aulas no total.

Uma cabeça é limitante

Uma única cabeça de atenção consegue acompanhar apenas um tipo de relação por vez. A linguagem real exige que muitos padrões sejam percebidos ao mesmo tempo. 🧠

Muitas cabeças, muitas perspectivas

A atenção com múltiplas cabeças executa vários cálculos de atenção em paralelo, cada um com suas próprias projeções aprendidas e seu próprio foco.

O que cada cabeça aprende

Uma cabeça pode acompanhar relações entre sujeito e verbo, enquanto outra acompanha pronomes. Juntas, elas capturam uma visão muito mais rica da frase.

Divida as dimensões

O modelo divide o tamanho do vetor entre as cabeças, portanto cada cabeça trabalha em um subespaço menor. O custo computacional total permanece aproximadamente igual.

d_head = d_model // num_heads

Combine as cabeças

Depois que cada cabeça produz uma saída, você as concatena e passa o resultado por mais uma camada linear para combinar as perspectivas.

out = concat(head_1, head_2, ...) @ W_o

A atenção ignora a ordem

A autoatenção trata a entrada como um conjunto; portanto, sozinha, não consegue distinguir "dog bites man" de "man bites dog". Ela é indiferente à ordem.

Adicionando informações de posição

Para corrigir isso, inserimos uma codificação posicional em cada palavra, para que o modelo saiba onde cada token está na sequência.

Codificações senoidais

O Transformer original usa ondas fixas de seno e cosseno, com frequências diferentes, para dar a cada posição uma assinatura única e suave.

pe[pos, 2i] = sin(pos / 10000 ** (2*i/d))

Adicionadas, não anexadas

Os vetores de posição são adicionados às representações vetoriais das palavras, e não colocados no final. Assim, cada token carrega seu significado e sua posição juntos.

x = token_embeddings + positional_encoding

Posições aprendidas também

Muitos modelos modernos substituem as ondas fixas por representações vetoriais de posição aprendidas, treinadas junto com todo o restante para oferecer mais flexibilidade.

Por que ambas são importantes

A atenção com múltiplas cabeças identifica muitas relações; as codificações posicionais restauram a ordem. Juntas, elas permitem que o Transformer realmente compreenda sequências. ✨

Verificação rápida

Vamos testar as posições e as cabeças.

Recapitulação

Você viu como a atenção com múltiplas cabeças captura muitas relações em paralelo, enquanto as codificações posicionais dão ao modelo uma noção de ordem. 🎯

Grátis para começar

Aprenda Python com um tutor de IA — grátis

Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.

Cursos
30
Aulas
120

Perguntas Frequentes

A aula “Atenção multicabeças e posições” é grátis?

Sim — o texto completo de “Atenção multicabeças e posições” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de NLP Academy, atualize para CoddyKit PRO. O curso de NLP Academy inclui 4 aulas no total.

O que vou aprender em “Atenção multicabeças e posições”?

Várias perspectivas e consciência da ordem. Você pratica NLP Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar NLP Academy?

Nenhuma experiência prévia é necessária. NLP Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.

Quanto tempo leva a aula “Atenção multicabeças e posições”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de NLP Academy?

Sim. Cada aula de NLP Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. A ideia de atenção
  2. Autoatenção, passo a passo
  3. Atenção multicabeças e posições
  4. Por dentro do bloco Transformer
← Voltar para NLP Academy