0Pricing
CUDA Academy · Leçon

Parcourir les phases des tuiles

Accumulez les sommes partielles sur plusieurs tuiles.

Parcourir les phases des tuiles est une leçon CUDA Academy gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage CUDA Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours CUDA Academy comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

The Dot Product Is Split

A full row times a full column is too big for one tile. So you split that long sum into chunks of width TILE, one chunk per phase.

Counting the Phases

If the matrices are N wide and tiles are TILE wide, you need N / TILE phases to cover the whole inner dimension.

int numPhases = (N + TILE - 1) / TILE;

The Outer Phase Loop

Wrap your load-sync-compute steps in a loop over phase. Each pass slides the tile window further along the row of A and column of B.

for (int phase = 0; phase < numPhases; ++phase) {
  // load, sync, compute, sync
}

Accumulate Across Phases

The local sum variable lives outside the loop, so it keeps growing. Each phase adds its slice of the dot product to the running total.

float sum = 0.0f;
for (int phase = 0; phase < numPhases; ++phase) { ... }

Tile Offset per Phase

Each phase shifts the column you read from A and the row you read from B by phase * TILE. That is how the window advances.

As[ty][tx] = A[row*N + phase*TILE + tx];
Bs[ty][tx] = B[(phase*TILE + ty)*N + col];

Sync After Loading

Just like before, call __syncthreads() after the loads so the tile is complete before anyone computes on it.

__syncthreads();

Compute This Phase's Slice

The inner loop adds TILE products into sum, using only the freshly loaded tile. It contributes one chunk of the final dot product.

for (int k = 0; k < TILE; ++k)
  sum += As[ty][k] * Bs[k][tx];

The Second Barrier

End each phase with another __syncthreads() so no thread overwrites the tile while a slower thread is still reading it. 🚧

__syncthreads(); // before the next phase loads

Why Two Syncs Matter

One barrier guards reads-after-load, the other guards loads-after-read. Together they keep every thread in lockstep across phases.

Write the Final Sum

After all phases finish, the running sum is the complete dot product. Store it into C once, guarded by a bounds check.

if (row < N && col < N)
  C[row*N + col] = sum;

Handling Ragged Sizes

When N is not a clean multiple of TILE, load zero for out-of-range elements so the extra products add nothing to the sum.

Quick Check

Think about where the running total lives during the phase loop.

Recap

You looped over phases, shifting tiles, syncing twice, and accumulating partial sums into one total. Now let us measure how much faster it is. 📈

Questions Fréquemment Posées

La leçon « Parcourir les phases des tuiles » est-elle gratuite ?

Oui — le texte complet de « Parcourir les phases des tuiles » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours CUDA Academy, passe à CoddyKit PRO. Le cours CUDA Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Parcourir les phases des tuiles » ?

Accumulez les sommes partielles sur plusieurs tuiles. Tu pratiques CUDA Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer CUDA Academy ?

Aucune expérience préalable n'est requise. CUDA Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.

Combien de temps prend la leçon « Parcourir les phases des tuiles » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon CUDA Academy ?

Oui. Chaque leçon CUDA Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Le noyau matmul naïf
  2. Tuiler le produit scalaire
  3. Parcourir les phases des tuiles
  4. Mesurer le gain de vitesse
← Retour à CUDA Academy