CUDA Academy · Aula

A API de fragmentos WMMA

Carregando, executando mma_sync e armazenando fragmentos.

Aula 3 de 413 etapas

A API de fragmentos WMMA é uma aula grátis de CUDA Academy no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de CUDA Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de CUDA Academy inclui 4 aulas no total.

A API WMMA

Para programar diretamente os Tensor Cores, você usa a WMMA, a API de multiplicação-acumulação de matrizes por agrupamento de threads no namespace nvcuda::wmma. 🧩

Um agrupamento de threads inteiro coopera

A WMMA atua em todo o agrupamento: todas as 32 threads de um agrupamento trabalham juntas em um bloco. Você pensa em blocos, não em threads individuais.

Conheça o fragmento

Um fragmento é o tipo de dado da WMMA que contém a parte de um agrupamento de um bloco de matriz. Cada thread possui discretamente alguns de seus elementos.

Três funções dos fragmentos

Você declara fragmentos identificados como matrix_a, matrix_b ou accumulator. A identificação informa à WMMA como esse bloco participa da multiplicação-acumulação.

As formas dos blocos são fixas

Os fragmentos usam tamanhos definidos, como 16 por 16 por 16. Você escolhe uma forma compatível; o hardware aceita apenas essas combinações.

Etapa 1: carregar

Primeiro, você chama load_matrix_sync para trazer um bloco da memória para um fragmento. Esse carregamento distribui os dados entre o agrupamento por você.

wmma::load_matrix_sync(a_frag, ptr, ldm);

Etapa 2: limpar o acumulador

Antes de adicionar, você zera o bloco de resultado com fill_fragment. Um acumulador limpo significa que suas somas começam em um valor conhecido.

wmma::fill_fragment(c_frag, 0.0f);

Etapa 3: multiplicar e acumular

A chamada principal é mma_sync. Ela executa D = A vezes B mais C nos fragmentos carregados, usando diretamente os Tensor Cores.

wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);

Etapa 4: armazenar

Por fim, store_matrix_sync grava o fragmento acumulador de volta na memória. Esse armazenamento reúne as partes de cada thread em um único bloco.

wmma::store_matrix_sync(out, c_frag, ldm, layout);

Sincronização significa sincronização do agrupamento

O sufixo _sync é um lembrete: toda chamada WMMA é sincronizada no agrupamento. Todas as 32 lanes devem alcançá-la juntas; caso contrário, o comportamento será indefinido.

Organização e dimensão principal

As operações de carregamento e armazenamento precisam da dimensão principal, o passo entre as linhas, além de uma organização por linhas ou por colunas para ler a memória corretamente.

Verificação rápida

Qual chamada WMMA realmente executa a multiplicação-acumulação de matrizes nos Tensor Cores?

Recapitulação

Você percorreu o fluxo da WMMA: declarar um fragmento, carregar os blocos, limpar o acumulador, chamar mma_sync e então armazenar. Cada etapa é sincronizada no agrupamento. 🙌

Grátis para começar

Aprenda C++ com um tutor de IA — grátis

Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.

Cursos
30
Aulas
120

Perguntas Frequentes

A aula “A API de fragmentos WMMA” é grátis?

Sim — o texto completo de “A API de fragmentos WMMA” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de CUDA Academy, atualize para CoddyKit PRO. O curso de CUDA Academy inclui 4 aulas no total.

O que vou aprender em “A API de fragmentos WMMA”?

Carregando, executando mma_sync e armazenando fragmentos. Você pratica CUDA Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar CUDA Academy?

Nenhuma experiência prévia é necessária. CUDA Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.

Quanto tempo leva a aula “A API de fragmentos WMMA”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de CUDA Academy?

Sim. Cada aula de CUDA Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. O que os Tensor Cores calculam
  2. Precisão mista: FP16, BF16, TF32
  3. A API de fragmentos WMMA
  4. Compromissos de estabilidade numérica
← Voltar para CUDA Academy