CUDA Academy · 课时

使用 NCCL 进行多 GPU 编程

用于扩展的集合通信

第 4 / 4 课13 个步骤

使用 NCCL 进行多 GPU 编程 是 CoddyKit 上的免费 CUDA Academy 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 CUDA Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 CUDA Academy 课程共包含 4 节课。

手动实现很快会变复杂

在多个 GPU 之间手动连接点对点复制,很快就会变得杂乱。要实现真正的扩展,您需要一个专为集合通信构建的库。

认识 NCCL

NVIDIA 给出的解决方案是 NCCL,即集合通信库。它会自动使用能够找到的最快链路在 GPU 之间移动数据。

什么是集合通信

集合通信是一种所有 GPU 共同参与的操作,例如将每张卡上保存的一个值相加。所有设备会通过一次调用协同工作。

核心集合操作:AllReduce

最常用的操作是 AllReduce。它会合并每个 GPU 上的缓冲区,例如执行加法,然后将相同的结果返回给所有 GPU。

ncclAllReduce(send, recv, n, ncclFloat, ncclSum, comm, stream);

更多集合操作

NCCL 还提供 Broadcast,用于将一个 GPU 的数据共享给所有 GPU;此外还有 AllGather 和 ReduceScatter,可用于其他常见的数据交换模式。

通信器

相互通信的 GPU 会组成一个由通信器跟踪的组。每次集合调用都会传入这个句柄,以便 NCCL 知道参与者是谁。

使用秩标识 GPU

在一个通信器中,每个 GPU 都会获得一个称为秩的编号,从 0 开始。通过秩,您可以指定谁发送、谁接收,以及谁是根节点。

构建通信器

对于同一进程中的 GPU,ncclCommInitAll 会根据您提供的设备编号列表一次性设置所有通信器。

ncclCommInitAll(comms, nGpus, devs);

感知流

每次 NCCL 调用都会接收一个流。操作会在该流中排队,并与您的内核同时运行,因此通信可以与计算重叠。

对调用进行分组

为了在多个 GPU 上发起集合操作而不发生死锁,请将这些操作放在 ncclGroupStart 和 ncclGroupEnd 之间,以便 NCCL 一起启动它们。

ncclGroupStart();
// per-GPU calls
ncclGroupEnd();

训练为何依赖它

深度学习每一步都会在 GPU 之间同步梯度。AllReduce 正好执行这项工作,因此 NCCL 几乎支撑着所有多 GPU 训练。

快速检查

回想一下,NCCL 中哪个集合操作会对多个 GPU 上的缓冲区求和,并将结果返回给所有 GPU。

回顾

NCCL 会通过高速链路执行 AllReduce 等集体通信,这些通信由按排名排列的 GPU 通信器组织。它是多 GPU 训练的核心。课程完成。✨

免费开始

用 AI 导师学习 C++ — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
30
课程
120

常见问题解答

「使用 NCCL 进行多 GPU 编程」课时是免费的吗?

是的 — 「使用 NCCL 进行多 GPU 编程」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 CUDA Academy 课程的其余内容,请升级到 CoddyKit PRO。 CUDA Academy 课程共包含 4 节课。

「使用 NCCL 进行多 GPU 编程」这节课中我会学到什么?

用于扩展的集合通信 你通过在浏览器中直接运行的动手代码来练习 CUDA Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 CUDA Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 CUDA Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。

「使用 NCCL 进行多 GPU 编程」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 CUDA Academy 课中编写并运行代码吗?

能。每节 CUDA Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 枚举与选择设备
  2. 跨 GPU 划分工作
  3. 点对点内存访问
  4. 使用 NCCL 进行多 GPU 编程
← 返回 CUDA Academy