0Pricing
CUDA Academy icon

CUDA Academy

CPPEnterpriseDesktopAi

Programe a GPU com CUDA C++. De threads e hierarquia de memória a kernels, otimização e computação paralela real.

🤖 Com Inteligência Artificial📚 30 cursos👥 100.000+ alunos⭐ Classificação 4,9
Visão Geral do Curso

CUDA: Programação de GPU com C++

Programe a GPU com CUDA C++. De threads e hierarquia de memória a kernels, otimização e computação paralela real. Esta trilha cobre 30 mini-cursos progressivos do iniciante absoluto (A1) ao avançado (B2), com lições focadas e breves quizzes para fixar cada conceito.

O Que Você Aprenderá

Você começa com os fundamentos e avança por tópicos intermediários e avançados, cada curso construindo sobre o anterior. Cada lição é prática e em pequenas doses, com um tutor de IA disponível 24/7 quando você precisar de ajuda.

Como Funciona

Cada curso é dividido em quatro lições focadas e em pequenas doses. Complete algumas lições por dia e você dominará a trilha completa em semanas, não meses.

Comece a Aprender →

Como Você Aprenderá

🎯
Aulas Interativas
Exercícios de codificação práticos com feedback em tempo real
🤖
Tutor de IA
Obtenha ajuda instantânea de nossa IA quando você ficar preso
💻
Editor Integrado
Escreva e execute código diretamente no seu navegador
🏆
Certificado
Ganhe um certificado ao concluir o curso
Currículo

30 Cursos

Todos os cursos no caminho de aprendizado CUDA Academy.

01

Por que as GPUs arrasam em tarefas paralelas

A14 aulas

Explique o que é uma GPU e por que milhares de núcleos pequenos superam alguns núcleos CPU rápidos em problemas paralelos

02

Configure seu conjunto de ferramentas CUDA

A14 aulasPRO

Instale o CUDA Toolkit, verifique seu driver e compile seu primeiro programa com nvcc

03

Host versus dispositivo: dois mundos

A14 aulasPRO

Distinga o código host da CPU do código de dispositivo da GPU e saiba qual memória cada lado pode acessar

04

Escreva seu primeiro kernel

A14 aulasPRO

Defina, inicie e execute um kernel de GPU que imprime dados de dentro do dispositivo

05

Threads, blocos e grades

A14 aulasPRO

Mapeie um problema para a hierarquia de threads, blocos e grade do CUDA

06

Indexação global de threads

A24 aulasPRO

Calcule um índice global exclusivo para que cada thread processe exatamente um elemento de dados

07

Gerencie a memória do dispositivo

A24 aulasPRO

Aloque e libere memória da GPU e entenda a área de memória do dispositivo

08

Mova dados com cudaMemcpy

A24 aulasPRO

Transfira vetores entre host e dispositivo com segurança nas duas direções

09

Crie uma adição de vetores de ponta a ponta

A24 aulasPRO

Escreva na GPU um programa completo C = A + B, da alocação à verificação

10

Capture erros do CUDA corretamente

A24 aulasPRO

Detecte e informe falhas do CUDA em chamadas de API e inicializações de kernels

11

Mapeie a hierarquia de memória do CUDA

B14 aulasPRO

Escolha o espaço de memória certo entre global, compartilhado, constante, local e registradores

12

Combine os acessos à memória global

B14 aulasPRO

Organize os padrões de acesso para que uma warp leia memória contígua em uma única transação

13

Domine a memória compartilhada no chip

B14 aulasPRO

Use a memória __shared__ e __syncthreads para compartilhar dados dentro de um bloco

14

Use blocos nos algoritmos com memória compartilhada

B14 aulasPRO

Aplique o padrão de blocos carregar-sincronizar-calcular para reutilizar dados e reduzir o tráfego global

15

Multiplicação de matrizes em blocos

B14 aulasPRO

Crie um GEMM em blocos com memória compartilhada que supera amplamente a versão ingênua

16

Redução paralela feita corretamente

B14 aulasPRO

Some um vetor na GPU com eficiência usando uma redução baseada em árvore

17

Operações atômicas para concorrência segura

B14 aulasPRO

Use operações atômicas para atualizar resultados compartilhados sem condições de corrida

18

Sobreponha tarefas com fluxos CUDA

B14 aulasPRO

Execute kernels e transferências simultaneamente usando fluxos que não sejam o padrão

19

Transferências assíncronas e memória fixada

B14 aulasPRO

Acelere transferências com memória host fixada e cópias assíncronas em fluxos

20

Simplifique com memória unificada

B14 aulasPRO

Use cudaMallocManaged para um único ponteiro compartilhado pelo host e pelo dispositivo

21

Ajuste a ocupação e a configuração de inicialização

B24 aulasPRO

Escolha tamanhos de bloco e limite recursos para maximizar a ocupação de SM

22

Analise kernels com Nsight

B24 aulasPRO

Encontre gargalos usando métricas do Nsight Systems e do Nsight Compute

23

Primitivas e embaralhamentos no nível de warp

B24 aulasPRO

Troque dados dentro de uma warp com intrínsecos de embaralhamento e votação, sem memória compartilhada

24

Otimização avançada de kernels

B24 aulasPRO

Aplique ILP, desenrolamento de laços e carregamentos vetorizados para extrair o máximo desempenho

25

Escale entre várias GPUs

B24 aulasPRO

Divida o trabalho entre várias GPUs e mova dados diretamente entre elas com P2P

26

Acelere com cuBLAS e Thrust

B24 aulasPRO

Chame as bibliotecas otimizadas da NVIDIA para GEMM, ordenação e algoritmos paralelos

27

Paralelismo dinâmico e grafos CUDA

B24 aulasPRO

Inicie kernels a partir do dispositivo e capture tarefas em grafos CUDA reutilizáveis

28

Programe núcleos tensoriais

B24 aulasPRO

Use núcleos tensoriais de precisão mista por meio da API WMMA para cálculos rápidos de matrizes

29

Depure com cuda-gdb e Sanitizer

B24 aulasPRO

Investigue falhas, condições de corrida e erros de memória com as ferramentas de depuração do CUDA

30

Projeto final: um pipeline de imagens na GPU

B24 aulasPRO

Combine kernels, fluxos e criação de perfis em um processador de imagens real acelerado por GPU

Perguntas Frequentes

Perguntas Frequentes

O curso CUDA Academy é gratuito?

Sim. Você pode começar o curso CUDA Academy gratuitamente e completar suas aulas interativas sem custo. Uma assinatura PRO opcional desbloqueia ferramentas avançadas de IA e um certificado compartilhável.

Preciso de experiência anterior para aprender CPP?

Não. O curso começa com os fundamentos e gradualmente passa para tópicos mais avançados, então você pode começar mesmo sem experiência anterior com CPP.

Como vou aprender CPP no CoddyKit?

Você aprende fazendo. Aulas interativas curtas combinam uma explicação clara com um exercício de codificação prático que executa em tempo real, e um tutor de IA disponível 24/7 oferece ajuda personalizada sempre que você ficar preso.

Ganho um certificado ao concluir CUDA Academy?

Sim. Alunos PRO podem fazer um exame e ganhar um certificado de conclusão compartilhável com um código verificável para o curso CUDA Academy.

Posso aprender CPP no meu celular?

Sim. CoddyKit está disponível na web e como aplicativos nativos para iOS e Android, então você pode aprender CPP em qualquer dispositivo e seu progresso sincroniza entre eles.

Comece CUDA Academy Agora

Junte-se a milhares de alunos dominando programação com aulas potenciadas por IA.

Começar Grátis →Ver Todos os Cursos