0Pricing
Deep Learning Academy · Aula

Codificação Posicional para a Ordem

Insira a posição da sequência nos tokens

Codificação Posicional para a Ordem é uma aula grátis de Deep Learning Academy no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Deep Learning Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Deep Learning Academy inclui 4 aulas no total.

Partes desta aula ainda não foram traduzidas e aparecem em inglês.

Attention Ignores Order

Self-attention treats a sentence like a bag of tokens. Shuffle the words and the math barely changes, so the model has no built-in sense of order.

Order Carries Meaning

But order matters: "dog bites man" is not "man bites dog". We must hand the model some signal about each token's position.

Add, Do Not Append

The trick is to add a position vector directly to each token's embedding. Same shape, so attention sees content and place fused together.

x = token_emb + pos_emb

Sinusoidal Encoding

The original transformer used fixed sine and cosine waves of different frequencies, one pattern per dimension, to mark each position.

Why Sine Waves

Mixing frequencies gives every position a unique fingerprint, and the smooth waves let the model generalize to lengths it never saw in training.

The Formula

Even dimensions use sine, odd dimensions use cosine, with the wavelength growing across dimensions. That is the whole encoding recipe.

pe[:, 0::2] = torch.sin(pos / div)
pe[:, 1::2] = torch.cos(pos / div)

Relative Distance

A neat bonus: with sinusoids, the offset between two positions is easy to express, helping attention reason about relative distance.

Learned Positions

Modern models often skip sinusoids and use a learned embedding table, one trainable vector per position, just like word embeddings.

self.pos_emb = nn.Embedding(max_len, d_model)

Fixed vs Learned

Fixed sinusoids extrapolate to new lengths for free; learned tables fit your data but are capped at the maximum length you trained on.

Rotary Encoding

Newer transformers favor rotary position encoding, which rotates query and key vectors by an angle tied to position, baking order into attention itself.

Where It Goes

Whatever scheme you pick, positional info is injected once at the input, before the first attention layer ever runs.

Quick Check

Let's check why positional encoding exists.

Recap

You learned that attention ignores order, so we add positional encodings, whether sinusoidal, learned, or rotary, to tell tokens where they sit. Well done!

Perguntas Frequentes

A aula “Codificação Posicional para a Ordem” é grátis?

Sim — o texto completo de “Codificação Posicional para a Ordem” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Deep Learning Academy, atualize para CoddyKit PRO. O curso de Deep Learning Academy inclui 4 aulas no total.

O que vou aprender em “Codificação Posicional para a Ordem”?

Insira a posição da sequência nos tokens Você pratica Deep Learning Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar Deep Learning Academy?

Nenhuma experiência prévia é necessária. Deep Learning Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.

Quanto tempo leva a aula “Codificação Posicional para a Ordem”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de Deep Learning Academy?

Sim. Cada aula de Deep Learning Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Atenção Própria: Consulta, Chave e Valor
  2. Produto Escalar Dimensionado e Múltiplas Cabeças
  3. Codificação Posicional para a Ordem
  4. Empilhe um Bloco Codificador Transformer
← Voltar para Deep Learning Academy