加载—同步—计算模式
在计算数据块前先将其载入暂存区
加载—同步—计算模式 是 CoddyKit 上的免费 CUDA Academy 课时。 这是第 2 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 CUDA Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 CUDA Academy 课程共包含 4 节课。
三个简单阶段
每个内核中的分块都遵循同样的节奏:将一个分块加载到共享内存中,执行同步,然后基于快速副本进行计算。
第一阶段:加载
在加载阶段,每个线程从全局内存读取一个元素,并将其存入整个线程块都能看到的共享内存分块中。
tile[threadIdx.x] = in[globalIndex];协作完成
加载是一项团队工作。每个线程获取自己负责的部分,整个线程块协作起来,就能通过一次合并访问完整地暂存一个分块。
第二阶段:同步
在任何线程读取邻居的值之前,所有线程都必须完成加载。__syncthreads 是确保分块准备就绪的屏障。
__syncthreads();为什么同步不可省略
如果跳过屏障,某个线程可能会读取一个其邻居尚未写入的分块位置。这会产生竞争并导致错误结果。💥
第三阶段:计算
现在每个值都位于片上。在计算阶段,线程可以自由读取分块中的条目,因为共享内存比全局内存快几个数量级。
快速复用带来收益
由于分块位于共享内存中,一个只加载一次的值可以被多个线程复用,几乎不会产生额外成本。这就是全部收益。
有时需要再次同步
如果计算阶段将结果写回同一个分块,并用于下一步计算,请在重新使用这些位置前添加第二个 __syncthreads。
要么全部线程,要么一个也不能少
线程块中的每个线程都必须到达 __syncthreads。如果某些线程在分支中跳过它,内核就会死锁或行为异常。
可复用的基本结构
加载、同步、计算是一个模板,您将在本类别的卷积、矩阵乘法和归约中反复使用它。
注意分块大小
共享内存分块必须适合线程块。分块宽度通常等于 blockDim,因此每个线程恰好负责一个要加载和复用的位置。
快速检查
为什么必须在加载和计算之间使用 __syncthreads?
回顾
分块就是加载、同步、计算:协作暂存一个分块,用屏障确保它完整,然后在片上快速复用。✅
用 AI 导师学习 C++ — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「加载—同步—计算模式」课时是免费的吗?
是的 — 「加载—同步—计算模式」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 CUDA Academy 课程的其余内容,请升级到 CoddyKit PRO。 CUDA Academy 课程共包含 4 节课。
「加载—同步—计算模式」这节课中我会学到什么?
在计算数据块前先将其载入暂存区 你通过在浏览器中直接运行的动手代码来练习 CUDA Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 CUDA Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 CUDA Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 4 节。
「加载—同步—计算模式」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 CUDA Academy 课中编写并运行代码吗?
能。每节 CUDA Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。