CUDA Academy · 课时

按需迁移页面

发生缺页时,将数据移到使用它的位置

第 2 / 4 课13 个步骤

按需迁移页面 是 CoddyKit 上的免费 CUDA Academy 课时。 这是第 2 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 CUDA Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 CUDA Academy 课程共包含 4 节课。

数据存放在哪里?

使用托管内存时,数据没有固定位置。它会通过按需页面迁移在 CPU 和 GPU 之间悄然移动,跟随您的使用位置。

内存由页面组成

系统会以固定大小的数据块来跟踪内存,这些数据块称为页面,通常大小为 4 KB 或 64 KB。迁移一次移动一个页面,而不是逐字节移动。

页面错误会触发迁移

当 GPU 访问位于 CPU 上的页面时,就会触发页面错误。驱动程序会暂停执行,将该页面拷贝过去,然后让线程继续运行。

数据跟随访问位置移动

规则很简单:数据会迁移到使用它的一方。在 CPU 上写入时,页面位于 CPU;在内核中读取时,页面会移动到 GPU。

第一次访问最慢

从新的一方进行第一次访问时才会产生这项开销。页面到达后,同一设备上的后续读取会快速完成,因为数据已经位于本地。

来回抖动会造成损耗

如果 CPU 和 GPU 轮流访问相同的页面,这些页面就会来回移动。这种来回抖动式迁移可能在不知不觉中严重损害吞吐量。

页面错误会不断累积

每次页面错误都会带来设置开销,因此成千上万个微小的页面错误代价很高。以批量方式迁移比逐个处理分散的页面错误更高效。

局部性仍然重要

即使迁移是自动进行的,良好的访问模式仍然更有优势。读取相邻地址的线程可以高效地载入整页,而不是产生分散的页面错误。

允许超额使用

迁移机制允许您分配超过 GPU 容量的内存。页面会按需流入,旧页面则会被驱逐,因此即使是超大数据集也能运行,只是速度更慢。

您可以观察页面错误

Nsight Systems 等性能分析器可以显示迁移流量和页面错误计数。发现大量迁移后,您就能准确知道下一步该在哪里添加提示。

便利性也有代价

按需迁移非常自动化,但页面错误并不是没有代价。了解这项成本,才能通过预取和建议来修复问题。

快速检查

让我们确认一下,什么会触发迁移。

回顾:按需迁移

您已经看到,托管内存页面会在发生页面错误时迁移到使用它的一方。第一次访问较慢,来回抖动会造成损耗,而批量移动更有优势。继续前进!🚀

免费开始

用 AI 导师学习 C++ — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
30
课程
120

常见问题解答

「按需迁移页面」课时是免费的吗?

是的 — 「按需迁移页面」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 CUDA Academy 课程的其余内容,请升级到 CoddyKit PRO。 CUDA Academy 课程共包含 4 节课。

「按需迁移页面」这节课中我会学到什么?

发生缺页时,将数据移到使用它的位置 你通过在浏览器中直接运行的动手代码来练习 CUDA Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 CUDA Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 CUDA Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 4 节。

「按需迁移页面」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 CUDA Academy 课中编写并运行代码吗?

能。每节 CUDA Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 一个指针,两端通用
  2. 按需迁移页面
  3. 使用 cudaMemPrefetchAsync 预取
  4. 通过 cudaMemAdvise 提供提示
← 返回 CUDA Academy