测量加速效果
比较朴素实现与分块实现的性能
测量加速效果 是 CoddyKit 上的免费 CUDA Academy 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 CUDA Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 CUDA Academy 课程共包含 4 节课。
验证性能提升
您已经构建了一个分块内核,但它到底快了多少?测量可以将猜测变成一个值得信赖的数字。📊
使用 GPU 时钟计时
使用 CUDA 事件为内核计时。它们位于 GPU 流中,可以准确测量工作开始和结束的时间。
cudaEvent_t start, stop;
cudaEventCreate(&start);
cudaEventCreate(&stop);在内核两侧记录事件
在启动前记录一个事件,在启动后再记录另一个,然后进行同步,确保计时确实等待 GPU 完成工作。
cudaEventRecord(start);
matmul<<<g,b>>>(...);
cudaEventRecord(stop);
cudaEventSynchronize(stop);读取经过的时间
请获取两个事件之间的时间差,单位为毫秒。这个数字就是测得的内核运行时间。
float ms;
cudaEventElapsedTime(&ms, start, stop);先进行预热
第一次启动会承担一次性的初始化开销。在计时前运行一个预热内核,这样测量到的是稳定状态下的速度,而不是启动开销。
对多次运行取平均值
单个样本可能存在较大波动。请多次为内核计时,并取平均值,以获得稳定且真实的结果。
计算加速比
加速比就是朴素版本的时间除以分块版本的时间。4x 表示分块内核运行速度快了四倍。
float speedup = naive_ms / tiled_ms;用 GFLOPS 思考
矩阵乘法大约执行 2 * N^3 次浮点运算。将其除以运行时间,就可以用 GFLOPS 报告性能,这是标准的衡量指标。
double gflops = (2.0*N*N*N) / (ms * 1e6);分块技术为何有效
性能提升来自大幅减少全局内存流量。共享内存的重复使用让计算核心持续获得数据,而不必等待缓慢的加载。
始终验证正确性
错误但快速的答案毫无用处。在庆祝加速比之前,请将 GPU 结果与 CPU 参考结果进行比较。
了解性能上限
即使是分块矩阵乘法,性能也通常落后于手工调优的 cuBLAS。了解差距后,您就能判断何时需要继续优化,何时应调用库。
快速检查
请回忆为 GPU 内核计时的正确工具。
回顾
您使用CUDA 事件进行了计时,完成了预热和取平均值,计算了加速比和 GFLOPS,并验证了正确性。现在,您已经能够证明优化的效果。🏁
用 AI 导师学习 C++ — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「测量加速效果」课时是免费的吗?
是的 — 「测量加速效果」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 CUDA Academy 课程的其余内容,请升级到 CoddyKit PRO。 CUDA Academy 课程共包含 4 节课。
「测量加速效果」这节课中我会学到什么?
比较朴素实现与分块实现的性能 你通过在浏览器中直接运行的动手代码来练习 CUDA Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 CUDA Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 CUDA Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。
「测量加速效果」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 CUDA Academy 课中编写并运行代码吗?
能。每节 CUDA Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。