Combinare SIMD e cicli
Vettorializzi il nucleo del kernel.
Combinare SIMD e cicli è una lezione Mojo Academy gratuita su CoddyKit. Questa è la lezione 2 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Mojo Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Mojo Academy include 4 lezioni in totale.
Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.
From Scalar to SIMD
To accelerate a kernel, swap the one-at-a-time loop for one that handles a whole pack of values per step with SIMD.
for i in range(n):
out[i] = a[i] + b[i]Pick a Width
Choose how many elements fit in one vector. The width is the number of lanes each step processes together.
alias width = 4Load a Chunk
Grab several elements at once into a SIMD value with a vector load instead of reading them one by one.
var va = a.load[width=width](i)Compute the Pack
Run the kernel's math on both chunks at once. The whole pack is added element-wise in a single operation.
var vsum = a.load[width=width](i) + b.load[width=width](i)Store the Pack
Write the full result back with a vector store, covering every lane you just computed in one move.
out.store[width=width](i, vsum)Step by the Width
The vectorized loop advances by the width, not by one. Each pass covers a full pack of elements.
for i in range(0, n, width):
passLet vectorize Help
Mojo's vectorize helper sweeps a closure across the range in vector steps so you skip the manual bookkeeping.
from algorithm import vectorizeWrite the Chunk Closure
You define a small parameterized function that handles one chunk. Mojo calls it with the right width as it sweeps.
fn body[w: Int](i: Int):
out.store[width=w](i, a.load[width=w](i) + b.load[width=w](i))Run vectorize
Call vectorize with your closure, the width, and the size. It loops and even handles the leftover tail for you.
vectorize[body, width](n)Mind the Tail
When n is not a multiple of the width, a few elements remain. vectorize cleans up that tail so nothing is missed.
Same Output, More Speed
The vectorized kernel produces identical results but moves through data in big steps, so it finishes much sooner.
Quick Check
You vectorize a kernel with width 4 but n is 10. What handles the last two elements?
Recap
Vectorize a kernel by loading and storing packs, stepping by the width, and letting vectorize handle the sweep and the tail. 🚀
Domande Frequenti
La lezione «Combinare SIMD e cicli» è gratuita?
Sì — il testo completo di «Combinare SIMD e cicli» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Mojo Academy, passa a CoddyKit PRO. Il corso Mojo Academy include 4 lezioni in totale.
Cosa imparerò in «Combinare SIMD e cicli»?
Vettorializzi il nucleo del kernel. Eserciti Mojo Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare Mojo Academy?
Non è richiesta alcuna esperienza precedente. Mojo Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 2 di 4.
Quanto tempo richiede la lezione «Combinare SIMD e cicli»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione Mojo Academy?
Sì. Ogni lezione Mojo Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Anatomia di un kernel di calcolo
- Combinare SIMD e cicli
- Ridurre il traffico di memoria
- Tiling per la località della cache