0Pricing
CUDA Academy · Lección

Bucles con salto de cuadrícula

Gestione arrays más grandes que la cuadrícula.

Bucles con salto de cuadrícula es una lección gratuita de CUDA Academy en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de CUDA Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de CUDA Academy incluye 4 lecciones en total.

Partes de esta lección aún no han sido traducidas y se muestran en inglés.

When the Array Is Huge

Sometimes the data is far bigger than the threads you launch. One thread per element no longer fits, so you need each thread to handle several elements.

The Grid Has a Size

The total number of threads is the grid size: blocks times threads per block. This stride is how far apart each thread's elements sit.

int stride = blockDim.x * gridDim.x;

Start, Then Stride

Each thread begins at its usual global index, then jumps forward by the grid size again and again until it runs off the array.

The Grid-Stride Loop

This loop is the whole pattern: start at i, step by stride, stop at n. Any array size is covered no matter how many threads you launch.

for (int i = blockIdx.x * blockDim.x + threadIdx.x;
     i < n;
     i += stride) {
    out[i] = a[i] + b[i];
}

The Built-in Guard

Notice the loop condition i < n is itself the bounds check. Threads that start past the end simply never enter the loop.

How the Work Splits

With a stride of 4 threads, thread 0 does elements 0, 4, 8, while thread 1 does 1, 5, 9. The work is interleaved, not chunked.

Interleaving Helps Coalescing

Because neighboring threads still touch neighboring addresses each step, the access stays coalesced and memory bandwidth stays high.

Decouple Threads From Data

Now your launch size no longer depends on n. You can pick a thread count that fits the GPU and let the loop absorb any workload.

Tune for the Hardware

A common choice is enough blocks to fill every multiprocessor, then let each thread loop. This keeps the GPU busy without overlaunching.

It Also Works When Tiny

If n is smaller than the grid, each thread runs the loop body at most once. The pattern degrades gracefully to the simple case.

A Robust Default

Many CUDA pros write every elementwise kernel as a grid-stride loop. It is flexible, safe, and rarely the wrong choice. 🚀

Quick Check

Identify the stride.

Recap

You learned the grid-stride loop: start at the global index and step by blockDim.x * gridDim.x until i reaches n. One kernel now handles any array size. 🎉

Preguntas frecuentes

¿La lección «Bucles con salto de cuadrícula» es gratis?

Sí — el texto completo de «Bucles con salto de cuadrícula» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de CUDA Academy, actualiza a CoddyKit PRO. El curso de CUDA Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Bucles con salto de cuadrícula»?

Gestione arrays más grandes que la cuadrícula. Practicas CUDA Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar CUDA Academy?

No se requiere experiencia previa. CUDA Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.

¿Cuánto tiempo toma la lección «Bucles con salto de cuadrícula»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de CUDA Academy?

Sí. Cada lección de CUDA Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. La fórmula clásica de indexación
  2. Evitar índices fuera de rango
  3. Redondear hacia arriba el número de bloques
  4. Bucles con salto de cuadrícula
← Volver a CUDA Academy