Combinar SIMD con bucles
Vectorice el núcleo del kernel.
Combinar SIMD con bucles es una lección gratuita de Mojo Academy en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Mojo Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Mojo Academy incluye 4 lecciones en total.
Partes de esta lección aún no han sido traducidas y se muestran en inglés.
From Scalar to SIMD
To accelerate a kernel, swap the one-at-a-time loop for one that handles a whole pack of values per step with SIMD.
for i in range(n):
out[i] = a[i] + b[i]Pick a Width
Choose how many elements fit in one vector. The width is the number of lanes each step processes together.
alias width = 4Load a Chunk
Grab several elements at once into a SIMD value with a vector load instead of reading them one by one.
var va = a.load[width=width](i)Compute the Pack
Run the kernel's math on both chunks at once. The whole pack is added element-wise in a single operation.
var vsum = a.load[width=width](i) + b.load[width=width](i)Store the Pack
Write the full result back with a vector store, covering every lane you just computed in one move.
out.store[width=width](i, vsum)Step by the Width
The vectorized loop advances by the width, not by one. Each pass covers a full pack of elements.
for i in range(0, n, width):
passLet vectorize Help
Mojo's vectorize helper sweeps a closure across the range in vector steps so you skip the manual bookkeeping.
from algorithm import vectorizeWrite the Chunk Closure
You define a small parameterized function that handles one chunk. Mojo calls it with the right width as it sweeps.
fn body[w: Int](i: Int):
out.store[width=w](i, a.load[width=w](i) + b.load[width=w](i))Run vectorize
Call vectorize with your closure, the width, and the size. It loops and even handles the leftover tail for you.
vectorize[body, width](n)Mind the Tail
When n is not a multiple of the width, a few elements remain. vectorize cleans up that tail so nothing is missed.
Same Output, More Speed
The vectorized kernel produces identical results but moves through data in big steps, so it finishes much sooner.
Quick Check
You vectorize a kernel with width 4 but n is 10. What handles the last two elements?
Recap
Vectorize a kernel by loading and storing packs, stepping by the width, and letting vectorize handle the sweep and the tail. 🚀
Preguntas frecuentes
¿La lección «Combinar SIMD con bucles» es gratis?
Sí — el texto completo de «Combinar SIMD con bucles» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Mojo Academy, actualiza a CoddyKit PRO. El curso de Mojo Academy incluye 4 lecciones en total.
¿Qué aprenderé en «Combinar SIMD con bucles»?
Vectorice el núcleo del kernel. Practicas Mojo Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar Mojo Academy?
No se requiere experiencia previa. Mojo Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.
¿Cuánto tiempo toma la lección «Combinar SIMD con bucles»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de Mojo Academy?
Sí. Cada lección de Mojo Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Anatomía de un kernel de cálculo
- Combinar SIMD con bucles
- Reducir el tráfico de memoria
- Usar teselado para mejorar la localidad de caché