CUDA Academy · 课时

CUDA 程序的生命周期

分配、复制、启动、复制回来、释放

第 4 / 4 课13 个步骤

CUDA 程序的生命周期 是 CoddyKit 上的免费 CUDA Academy 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 CUDA Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 CUDA Academy 课程共包含 4 节课。

周而复始的节奏

几乎每个 CUDA 程序都遵循同样的五步流程。掌握一次这个节奏,您就能读懂任何 GPU 代码。🕺

第 1 步:分配

首先,使用 cudaMalloc 为输入和输出预留设备内存,因为 GPU 不能直接使用主机缓冲区。

cudaMalloc(&d_a, bytes);
cudaMalloc(&d_b, bytes);

第 2 步:复制到设备

接下来,使用 cudaMemcpy 将输入数据从主机上传到设备。此时 GPU 就有了一份可供处理的数据副本。

cudaMemcpy(d_a, h_a, bytes, cudaMemcpyHostToDevice);

第 3 步:启动

现在,让您的内核在许多线程中启动。并行工作正是在设备上真正进行的地方。🚀

myKernel<<<blocks, threads>>>(d_a, d_b, n);

第 4 步:复制回来

计算完成后,将结果从设备下载到主机,这样 CPU 就能读取和使用这些结果。

cudaMemcpy(h_b, d_b, bytes, cudaMemcpyDeviceToHost);

第 5 步:释放

最后,使用 cudaFree释放每个设备缓冲区。跳过这一步会泄漏 GPU 内存,使其他工作无法使用它。

cudaFree(d_a);
cudaFree(d_b);

别忘了同步

由于启动是异步的,请在读取结果前调用 cudaDeviceSynchronize,确保 GPU 确实已经完成。

cudaDeviceSynchronize();

复制需要时间

复制步骤需要经过速度较慢的 PCIe 总线,因此数据传输往往才是真正的瓶颈,而不是内核本身。

重复使用缓冲区

只分配一次,并在多次启动之间重复使用缓冲区,比循环的每次迭代都分配新内存更高效。

流程的对称性

请注意其中的对称性:每个 cudaMalloc 都对应一个 cudaFree,每次复制到设备最终也都对应一次复制回主机。

一口气说完整个生命周期

把它当作口诀来说:分配、复制、启动、复制回来、释放。这一行就是几乎所有内核程序的骨架。

快速检查

让我们检查一下标准 CUDA 程序的生命周期。

回顾

您已经学会了 CUDA 的五步生命周期:分配、复制到设备、启动、复制回来、释放,以及在读取结果前进行同步。🎉

免费开始

用 AI 导师学习 C++ — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
30
课程
120

常见问题解答

「CUDA 程序的生命周期」课时是免费的吗?

是的 — 「CUDA 程序的生命周期」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 CUDA Academy 课程的其余内容,请升级到 CoddyKit PRO。 CUDA Academy 课程共包含 4 节课。

「CUDA 程序的生命周期」这节课中我会学到什么?

分配、复制、启动、复制回来、释放 你通过在浏览器中直接运行的动手代码来练习 CUDA Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 CUDA Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 CUDA Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。

「CUDA 程序的生命周期」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 CUDA Academy 课中编写并运行代码吗?

能。每节 CUDA Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. __global__ 函数限定符
  2. __device__ 与 __host__ 函数
  3. 分离的地址空间
  4. CUDA 程序的生命周期
← 返回 CUDA Academy