逐步构建矩阵乘法
从朴素循环到真正的内核
逐步构建矩阵乘法 是 CoddyKit 上的免费 Mojo Academy 课时。 这是第 2 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Mojo Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Mojo Academy 课程共包含 4 节课。
矩阵乘法的计算内容
矩阵乘法,即 matmul,将一个 M×K 矩阵与一个 K×N 矩阵组合,生成一个 M×N 的结果。这是人工智能数学计算的核心。
点积规则
每个输出单元格都是一个点积:遍历 A 的一行和 B 的一列,边遍历边相乘并求和。
三个嵌套循环
朴素版本使用三个循环,分别遍历 i、j 和 k。外层两个循环选定输出单元格,内层循环将乘积相加。
for i in range(M):
for j in range(N):
for k in range(K):
C[i, j] += A[i, k] * B[k, j]将每个单元格从零开始
累加之前,请将每个结果单元格设为零。否则,旧值或垃圾值会污染求和结果。
C[i, j] = 0.0累加总和
内层 k 循环会维护一个持续更新的累加器。将结果累加到局部变量中,通常比每一步都访问 C 更快。
var acc: Float32 = 0.0
for k in range(K):
acc += A[i, k] * B[k, j]
C[i, j] = acc使用 fn 提速
使用 fn 和带类型的参数编写内核。严格的类型让 Mojo 能够编译出紧凑的机器代码,不产生动态开销。
fn matmul(A: Matrix, B: Matrix, C: Matrix):
pass朴素实现为何缓慢
基础的三重循环虽然计算正确,但会按列读取 B,在内存中跳跃访问。较差的局部性会浪费缓存和时间。
循环顺序很重要
将顺序调整为 i、k、j 后,内层循环就能沿着内存连续访问。更好的访问模式可以显著加快 matmul。
for i in range(M):
for k in range(K):
for j in range(N):
C[i, j] += A[i, k] * B[k, j]内层循环才是目标
几乎所有时间都花在最内层循环中。这个高频的内层循环正是向量化和调优发挥作用的地方。
先确保正确
先让简单版本正确运行并保存其输出。它会成为参考实现,用于与每个更快的内核进行比较。
迈向真正内核的路径
接下来,您可以加入 SIMD、分块和并行处理。每一步都保持相同的结果,同时提高吞吐量,逐步接近硬件峰值速度。
快速检查
为什么教科书式的三重循环 matmul 在实践中通常很慢?
回顾
Matmul 通过三个循环为每个输出单元格计算一个点积;将单元格从零开始,在局部变量中累加,并注意循环顺序对缓存的影响。🔢
用 AI 导师学习 Mojo — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「逐步构建矩阵乘法」课时是免费的吗?
是的 — 「逐步构建矩阵乘法」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Mojo Academy 课程的其余内容,请升级到 CoddyKit PRO。 Mojo Academy 课程共包含 4 节课。
「逐步构建矩阵乘法」这节课中我会学到什么?
从朴素循环到真正的内核 你通过在浏览器中直接运行的动手代码来练习 Mojo Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Mojo Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Mojo Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 4 节。
「逐步构建矩阵乘法」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Mojo Academy 课中编写并运行代码吗?
能。每节 Mojo Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 在 Mojo 中建模张量
- 逐步构建矩阵乘法
- 优化内积
- 验证数值正确性