Costruire una matmul passo dopo passo
Dai cicli ingenui a un vero kernel.
Costruire una matmul passo dopo passo è una lezione Mojo Academy gratuita su CoddyKit. Questa è la lezione 2 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Mojo Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Mojo Academy include 4 lezioni in totale.
Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.
What Matmul Computes
Matrix multiply, or matmul, combines an M by K matrix with a K by N matrix to produce an M by N result. It is the heart of AI math.
The Dot Product Rule
Each output cell is a dot product: walk across one row of A and down one column of B, multiplying and summing as you go.
Three Nested Loops
The naive version uses three loops over i, j, and k. The outer two pick the output cell, the inner one sums the products.
for i in range(M):
for j in range(N):
for k in range(K):
C[i, j] += A[i, k] * B[k, j]Start Each Cell at Zero
Before accumulating, set each result cell to zero. Otherwise old or garbage values pollute your sum.
C[i, j] = 0.0Accumulate the Sum
The inner k loop keeps a running accumulator. Summing into a local variable is often faster than touching C every step.
var acc: Float32 = 0.0
for k in range(K):
acc += A[i, k] * B[k, j]
C[i, j] = accUse fn for Speed
Write the kernel with fn and typed arguments. Strict types let Mojo compile tight machine code with no dynamic overhead.
fn matmul(A: Matrix, B: Matrix, C: Matrix):
passWhy Naive Is Slow
The basic triple loop does the right math but reads B by column, jumping through memory. Poor locality wastes cache and time.
Loop Order Matters
Reordering to i, k, j keeps the inner loop walking memory in straight lines. Better access patterns can speed matmul a lot.
for i in range(M):
for k in range(K):
for j in range(N):
C[i, j] += A[i, k] * B[k, j]The Inner Loop Is the Target
Nearly all the time lives in the innermost loop. That hot inner loop is exactly where vectorizing and tuning pay off.
Correctness First
Get the simple version right and save its output. It becomes the reference you compare every faster kernel against.
A Path to a Real Kernel
From here you add SIMD, tiling, and parallelism. Each step keeps the same result but raises throughput toward peak hardware speed.
Quick Check
Why is the textbook triple-loop matmul often slow in practice?
Recap
Matmul sums a dot product per output cell with three loops; start cells at zero, accumulate locally, and mind loop order for cache. 🔢
Domande Frequenti
La lezione «Costruire una matmul passo dopo passo» è gratuita?
Sì — il testo completo di «Costruire una matmul passo dopo passo» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Mojo Academy, passa a CoddyKit PRO. Il corso Mojo Academy include 4 lezioni in totale.
Cosa imparerò in «Costruire una matmul passo dopo passo»?
Dai cicli ingenui a un vero kernel. Eserciti Mojo Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare Mojo Academy?
Non è richiesta alcuna esperienza precedente. Mojo Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 2 di 4.
Quanto tempo richiede la lezione «Costruire una matmul passo dopo passo»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione Mojo Academy?
Sì. Ogni lezione Mojo Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Modellare un tensore in Mojo
- Costruire una matmul passo dopo passo
- Ottimizzare il prodotto scalare
- Verificare la correttezza numerica