Цикл по этапам обработки фрагментов
Накапливайте частичные суммы по фрагментам.
«Цикл по этапам обработки фрагментов» — бесплатный урок CUDA Academy на CoddyKit. Это урок 3 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения CUDA Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс CUDA Academy содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
The Dot Product Is Split
A full row times a full column is too big for one tile. So you split that long sum into chunks of width TILE, one chunk per phase.
Counting the Phases
If the matrices are N wide and tiles are TILE wide, you need N / TILE phases to cover the whole inner dimension.
int numPhases = (N + TILE - 1) / TILE;The Outer Phase Loop
Wrap your load-sync-compute steps in a loop over phase. Each pass slides the tile window further along the row of A and column of B.
for (int phase = 0; phase < numPhases; ++phase) {
// load, sync, compute, sync
}Accumulate Across Phases
The local sum variable lives outside the loop, so it keeps growing. Each phase adds its slice of the dot product to the running total.
float sum = 0.0f;
for (int phase = 0; phase < numPhases; ++phase) { ... }Tile Offset per Phase
Each phase shifts the column you read from A and the row you read from B by phase * TILE. That is how the window advances.
As[ty][tx] = A[row*N + phase*TILE + tx];
Bs[ty][tx] = B[(phase*TILE + ty)*N + col];Sync After Loading
Just like before, call __syncthreads() after the loads so the tile is complete before anyone computes on it.
__syncthreads();Compute This Phase's Slice
The inner loop adds TILE products into sum, using only the freshly loaded tile. It contributes one chunk of the final dot product.
for (int k = 0; k < TILE; ++k)
sum += As[ty][k] * Bs[k][tx];The Second Barrier
End each phase with another __syncthreads() so no thread overwrites the tile while a slower thread is still reading it. 🚧
__syncthreads(); // before the next phase loadsWhy Two Syncs Matter
One barrier guards reads-after-load, the other guards loads-after-read. Together they keep every thread in lockstep across phases.
Write the Final Sum
After all phases finish, the running sum is the complete dot product. Store it into C once, guarded by a bounds check.
if (row < N && col < N)
C[row*N + col] = sum;Handling Ragged Sizes
When N is not a clean multiple of TILE, load zero for out-of-range elements so the extra products add nothing to the sum.
Quick Check
Think about where the running total lives during the phase loop.
Recap
You looped over phases, shifting tiles, syncing twice, and accumulating partial sums into one total. Now let us measure how much faster it is. 📈
Часто задаваемые вопросы
Урок «Цикл по этапам обработки фрагментов» бесплатный?
Да — полный текст урока «Цикл по этапам обработки фрагментов» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс CUDA Academy, подпишись на CoddyKit PRO. Курс CUDA Academy содержит 4 уроков всего.
Чему я научусь в уроке «Цикл по этапам обработки фрагментов»?
Накапливайте частичные суммы по фрагментам. Ты практикуешь CUDA Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать CUDA Academy?
Предыдущий опыт не требуется. CUDA Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 3 из 4.
Сколько времени занимает урок «Цикл по этапам обработки фрагментов»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке CUDA Academy?
Да. Каждый урок CUDA Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Наивное ядро умножения матриц
- Разбиение скалярного произведения на фрагменты
- Цикл по этапам обработки фрагментов
- Измерение ускорения