在设备与主机之间传输数据
管理主机与设备之间的内存传输
在设备与主机之间传输数据 是 CoddyKit 上的免费 Mojo Academy 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Mojo Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Mojo Academy 课程共包含 4 节课。
两块独立的内存
CPU 和 GPU 各自拥有独立的内存。在数据位于设备上之前,GPU 无法读取您的主机数组。
主机与设备
我们将 CPU 一侧称为主机,将 GPU 一侧称为设备。在两者之间移动数据是 GPU 工作的核心部分。
在设备上分配空间
首先,为数据在 GPU 上预留空间。这个设备缓冲区将用于存放输入和输出。
var d_a = ctx.enqueue_create_buffer[DType.float32](n)复制输入数据
接下来,将主机数组复制到这些设备缓冲区中。这次上传会把 GPU 所需的数值传过去。
ctx.enqueue_copy(d_a, h_a)运行 Kernel
数据位于设备上后,您就可以启动 kernel。它只读写设备缓冲区,不会读写主机缓冲区。
ctx.enqueue_function[kernel](grid_dim=blocks, block_dim=256)复制结果回来
输出会一直留在 GPU 上,直到您将其取回。下载会把结果缓冲区复制回主机内存。
ctx.enqueue_copy(h_out, d_out)工作是排队执行的,不会立即完成
这些调用会在 GPU 上排队,而不是立即完成。在主机上使用结果前,必须先执行 synchronize。
ctx.synchronize()完整往返
完整流程是上传、计算、下载。可以将其想象成数据从主机到设备再返回的往返过程。
传输需要时间
与计算相比,通过总线复制数据很慢。如果过于频繁,每次传输都可能抵消您的加速效果。
让数据留在设备上
在复制结果回来之前,让多个 kernel 使用同一批缓冲区连续执行。减少往返次数,才能保持 GPU 的加速优势。
释放已分配的内容
设备内存有限,因此请释放不再需要的缓冲区。Mojo 的所有权规则有助于在合适的时间释放它们。
快速检查
您希望 GPU 程序从头到尾真正运行得更快。
回顾
将输入上传到设备,运行 kernel,然后下载结果并执行同步,同时尽量减少代价高昂的传输。🔁
用 AI 导师学习 Mojo — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「在设备与主机之间传输数据」课时是免费的吗?
是的 — 「在设备与主机之间传输数据」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Mojo Academy 课程的其余内容,请升级到 CoddyKit PRO。 Mojo Academy 课程共包含 4 节课。
「在设备与主机之间传输数据」这节课中我会学到什么?
管理主机与设备之间的内存传输 你通过在浏览器中直接运行的动手代码来练习 Mojo Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Mojo Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Mojo Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。
「在设备与主机之间传输数据」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Mojo Academy 课中编写并运行代码吗?
能。每节 Mojo Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 为什么人工智能工作负载需要图形处理器
- 线程、块与网格
- 编写 GPU 内核函数
- 在设备与主机之间传输数据