Dela upp skalärprodukten i block
Läs in delblock av A och B för varje fas.
Dela upp skalärprodukten i block är en gratis lektion i CUDA Academy på CoddyKit. Detta är lektion 2 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för CUDA Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i CUDA Academy innehåller totalt 4 lektioner.
Idén med tiling
Tiling delar upp matriserna i små kvadratiska tiles som får plats i snabbt minne på chippet. Trådarna samarbetar för att läsa in en tile en gång och återanvända den många gånger.
Varför shared memory
En tile lagras i __shared__-minne och är synlig för alla trådar i blocket. Att läsa därifrån går mycket snabbare än att läsa från global memory om och om igen. ⚡
__shared__ float As[TILE][TILE];
__shared__ float Bs[TILE][TILE];Ett block, en output-tile
Varje block ansvarar för ett TILE gånger TILE stort område av output-matrisen C. Trådarna samarbetar för att beräkna hela området tillsammans.
Tile-storleken matchar blocket
Ni väljer TILE lika med blockets bredd, ofta 16 eller 32. Då läser varje tråd exakt ett element från varje tile.
#define TILE 16
dim3 threads(TILE, TILE);Mappa tråden till en tile-plats
Inuti tilen är trådens plats helt enkelt dess threadIdx. Den globala raden och kolumnen kommer fortfarande från block- och trådindexen.
int ty = threadIdx.y, tx = threadIdx.x;
int row = blockIdx.y*TILE + ty;
int col = blockIdx.x*TILE + tx;Läs in en tile av A
Varje tråd kopierar ett element från A:s aktuella tile till shared memory. Tillsammans läser blocket in ett helt TILE gånger TILE stort block av A.
As[ty][tx] = A[row*N + (phase*TILE + tx)];Läs in en tile av B
Samtidigt läser varje tråd in ett element från B:s tile. Nu ligger båda tiles på chippet och är redo för snabba upprepade läsningar.
Bs[ty][tx] = B[(phase*TILE + ty)*N + col];Synkronisera före beräkningen
Anropa __syncthreads() så att alla trådar hinner läsa in sina data innan någon läser tilen. Om Ni hoppar över detta blir resultaten felaktiga.
__syncthreads();Beräkna på tilen
Nu kör varje tråd en kort loop över tilen och läser endast från shared memory. Dessa läsningar är betydligt billigare än läsningar från global memory.
for (int k = 0; k < TILE; ++k)
sum += As[ty][k] * Bs[k][tx];Vinsten med återanvändning
Varje inläst värde används av TILE trådar i stället för en enda. Denna data reuse är hela anledningen till att matrismultiplikation med tiling går så snabbt.
En tile räcker inte
En enda tile täcker bara en del av skalärprodukten. Ni upprepar stegen läs in–synkronisera–beräkna över många faser, vilket nästa lektion behandlar.
Snabb kontroll
Återkalla ordningen på stegen när Ni arbetar med en shared tile.
Sammanfattning
Ni läste in tiles från A och B i shared memory, synkroniserade och beräknade sedan med billiga läsningar från chippet. Återanvändningen är vinsten. Faser kommer härnäst. 🧱
Lär dig C++ med en AI-lärare – gratis
Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.
- Kurser
- 30
- Lektioner
- 120
Vanliga frågor
Är lektionen ”Dela upp skalärprodukten i block” gratis?
Ja – hela texten till ”Dela upp skalärprodukten i block” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i CUDA Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i CUDA Academy innehåller totalt 4 lektioner.
Vad lär jag mig i ”Dela upp skalärprodukten i block”?
Läs in delblock av A och B för varje fas. Ni övar på CUDA Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.
Behöver jag någon erfarenhet för att börja lära mig CUDA Academy?
Du behöver inga förkunskaper. Utbildningen i CUDA Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 2 av 4.
Hur lång tid tar lektionen ”Dela upp skalärprodukten i block”?
De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.
Kan jag skriva och köra kod i den här CUDA Academy-lektionen?
Ja. Varje CUDA Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.
Alla lektioner i den här kursen
- Den naiva matmul-kärnan
- Dela upp skalärprodukten i block
- Loopa över blockfaser
- Mät prestandaökningen