CUDA Academy · Aula

Métricas de núcleos no Nsight Compute

Dados de vazão, esperas e gráfico de teto.

Aula 2 de 413 etapas

Métricas de núcleos no Nsight Compute é uma aula grátis de CUDA Academy no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de CUDA Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de CUDA Academy inclui 4 aulas no total.

Aproxime-se de um único kernel

O Nsight Compute é o microscópio de um único kernel. Ele coleta métricas detalhadas do hardware para que você veja exatamente por que a execução é lenta. 🔬

Como iniciá-lo

Você cria o perfil de um kernel com ncu pela linha de comando. Ele executa o kernel novamente várias vezes para coletar contadores detalhados.

ncu -o report ./my_cuda_app

Métricas de vazão

A primeira coisa a ler é a vazão: o quanto as unidades de processamento e os canais de memória estão ocupados, mostrado como uma porcentagem do pico.

Lendo as paradas das warps

Uma parada ocorre quando uma warp não consegue avançar naquele ciclo. O Nsight Compute agrupa as paradas por motivo, para que você saiba o que corrigir.

Paradas de memória

Se a maioria das paradas indicar memória, o seu kernel está aguardando dados. A solução é melhorar os padrões de acesso ou a reutilização, não fazer mais cálculos.

Ocupação alcançada

A ocupação alcançada mostra quantas warps estavam realmente ativas em comparação com o máximo. Valores baixos geralmente significam que há poucas warps para ocultar a latência.

O gráfico de teto

O gráfico de teto compara o seu kernel com os limites do hardware. A posição do ponto informa se o limite está no processamento ou na memória.

Análise orientada

O Nsight Compute escreve recomendações em linguagem simples. Ele aponta o maior gargalo, para que você não precise começar fazendo suposições.

Taxas de acerto do cache

Os contadores dos caches L1 e L2 mostram com que frequência as leituras encontram os dados no cache. Taxas de acerto maiores significam menos acessos à lenta memória global.

Comparando duas versões

Você pode comparar dois relatórios lado a lado. Assim, fica evidente se a sua alteração mais recente realmente melhorou as métricas.

Ele repete a execução, por isso é lento

Como ele repete a execução dos kernels, a sobrecarga da criação do perfil é alta. Use-o em um kernel por vez, não como uma execução normal.

Verificação rápida

O relatório do seu kernel mostra principalmente esperas de warps relacionadas à memória.

Recapitulação

O Nsight Compute revela as métricas de um kernel: vazão, esperas, ocupação e gráfico de teto. Use-o para confirmar exatamente o que deve ser otimizado. 👏

Grátis para começar

Aprenda C++ com um tutor de IA — grátis

Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.

Cursos
30
Aulas
120

Perguntas Frequentes

A aula “Métricas de núcleos no Nsight Compute” é grátis?

Sim — o texto completo de “Métricas de núcleos no Nsight Compute” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de CUDA Academy, atualize para CoddyKit PRO. O curso de CUDA Academy inclui 4 aulas no total.

O que vou aprender em “Métricas de núcleos no Nsight Compute”?

Dados de vazão, esperas e gráfico de teto. Você pratica CUDA Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar CUDA Academy?

Nenhuma experiência prévia é necessária. CUDA Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.

Quanto tempo leva a aula “Métricas de núcleos no Nsight Compute”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de CUDA Academy?

Sim. Cada aula de CUDA Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Visualização da linha do tempo no Nsight Systems
  2. Métricas de núcleos no Nsight Compute
  3. Limitado por cálculo versus limitado por memória
  4. Anote o código com NVTX
← Voltar para CUDA Academy