CUDA Academy · 课时

加载—同步—计算模式

在计算数据块前先将其载入暂存区

第 2 / 4 课13 个步骤

加载—同步—计算模式 是 CoddyKit 上的免费 CUDA Academy 课时。 这是第 2 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 CUDA Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 CUDA Academy 课程共包含 4 节课。

三个简单阶段

每个内核中的分块都遵循同样的节奏:将一个分块加载到共享内存中,执行同步,然后基于快速副本进行计算。

第一阶段:加载

在加载阶段,每个线程从全局内存读取一个元素,并将其存入整个线程块都能看到的共享内存分块中。

tile[threadIdx.x] = in[globalIndex];

协作完成

加载是一项团队工作。每个线程获取自己负责的部分,整个线程块协作起来,就能通过一次合并访问完整地暂存一个分块。

第二阶段:同步

在任何线程读取邻居的值之前,所有线程都必须完成加载。__syncthreads 是确保分块准备就绪的屏障。

__syncthreads();

为什么同步不可省略

如果跳过屏障,某个线程可能会读取一个其邻居尚未写入的分块位置。这会产生竞争并导致错误结果。💥

第三阶段:计算

现在每个值都位于片上。在计算阶段,线程可以自由读取分块中的条目,因为共享内存比全局内存快几个数量级。

快速复用带来收益

由于分块位于共享内存中,一个只加载一次的值可以被多个线程复用,几乎不会产生额外成本。这就是全部收益。

有时需要再次同步

如果计算阶段将结果写回同一个分块,并用于下一步计算,请在重新使用这些位置前添加第二个 __syncthreads。

要么全部线程,要么一个也不能少

线程块中的每个线程都必须到达 __syncthreads。如果某些线程在分支中跳过它,内核就会死锁或行为异常。

可复用的基本结构

加载、同步、计算是一个模板,您将在本类别的卷积、矩阵乘法和归约中反复使用它。

注意分块大小

共享内存分块必须适合线程块。分块宽度通常等于 blockDim,因此每个线程恰好负责一个要加载和复用的位置。

快速检查

为什么必须在加载和计算之间使用 __syncthreads?

回顾

分块就是加载、同步、计算:协作暂存一个分块,用屏障确保它完整,然后在片上快速复用。✅

免费开始

用 AI 导师学习 C++ — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
30
课程
120

常见问题解答

「加载—同步—计算模式」课时是免费的吗?

是的 — 「加载—同步—计算模式」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 CUDA Academy 课程的其余内容,请升级到 CoddyKit PRO。 CUDA Academy 课程共包含 4 节课。

「加载—同步—计算模式」这节课中我会学到什么?

在计算数据块前先将其载入暂存区 你通过在浏览器中直接运行的动手代码来练习 CUDA Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 CUDA Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 CUDA Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 4 节。

「加载—同步—计算模式」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 CUDA Academy 课中编写并运行代码吗?

能。每节 CUDA Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 数据复用问题
  2. 加载—同步—计算模式
  3. 模板与滑动窗口
  4. 处理边缘数据块
← 返回 CUDA Academy