CUDA Academy · Lektion

Sekventiell adressering

Konfliktfria steg i delat minne.

Lektion 3 av 413 steg

Sekventiell adressering är en gratis lektion i CUDA Academy på CoddyKit. Detta är lektion 3 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för CUDA Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i CUDA Academy innehåller totalt 4 lektioner.

Delat minne har banker

Delat minne är uppdelat i 32 banker, en per warp-lane. När 32 trådar träffar 32 olika banker sker alla läsningar under en enda snabb cykel.

Bankkonflikter gör det långsammare

Om två trådar i en warp använder samma bank uppstår en bankkonflikt. Hårdvaran serialiserar dessa åtkomster, vilket kostar extra cykler.

Interfolierad adressering

Den föregående reduktionen använde interfolierad adressering: steglängden börjar liten och fördubblas, så partnerna ligger nära varandra i det delade minnet.

int index = 2 * s * tid;
data[index] += data[index + s];

Varför interfoliering orsakar konflikter

Med små, fördubblade steglängder mappas flera lanes i en warp till samma bank. Dessa åtkomster kan inte längre ske under en enda cykel.

Vänd på steglängdsordningen

Sekventiell adressering börjar med en stor steglängd och halverar den i varje steg, alltså tvärtom mot interfoliering. Denna enda ändring tar bort konflikterna.

for (int s = blockDim.x / 2; s > 0; s >>= 1) {
  if (tid < s)
    data[tid] += data[tid + s];
  __syncthreads();
}

Stor steglängd, rena banker

En stor steglängd sprider partnernas adresser långt från varandra, så att varje lane hamnar i sin egen bank. Warpen läser utan konflikter under en enda cykel.

Villkoret tid < s

Endast den nedre hälften av trådarna arbetar i varje steg, uttryckt som tid < s. Det håller de aktiva trådarna sammanhängande, så att warps även fortsätter att vara icke-divergerande.

Två vinster på samma gång

Sekventiell adressering åtgärdar bankkonflikter och undviker warp-divergens i samma kernel. En layoutändring löser två prestandaproblem.

Synkronisera fortfarande i varje steg

Ni behöver fortfarande en __syncthreads efter varje steg. Trådarna måste se skrivningarna från den föregående nivån innan de läser för nästa nivå.

Resultatet hamnar på index 0

När steglängden halveras mot noll viks alla delsumma ihop till data[0]. Tråd 0 skriver sedan blockets resultat tillbaka till det globala minnet.

En klassisk optimering

Detta mönster kommer direkt från NVIDIA:s berömda reduktionsguide. Sekventiell adressering är ett klassiskt steg mot en konfliktfri kernel.

Snabb kontroll

Tänk på varför en stor, halverande steglängd är bättre än en liten, fördubblande.

Sammanfattning

Ni bytte ut interfolierad mot sekventiell adressering: steglängden börjar stor och halveras, vilket eliminerar bankkonflikter och divergens på samma gång. Nästa steg: summor över flera block. ✨

Gratis att börja

Lär dig C++ med en AI-lärare – gratis

Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.

Kurser
30
Lektioner
120

Vanliga frågor

Är lektionen ”Sekventiell adressering” gratis?

Ja – hela texten till ”Sekventiell adressering” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i CUDA Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i CUDA Academy innehåller totalt 4 lektioner.

Vad lär jag mig i ”Sekventiell adressering”?

Konfliktfria steg i delat minne. Ni övar på CUDA Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.

Behöver jag någon erfarenhet för att börja lära mig CUDA Academy?

Du behöver inga förkunskaper. Utbildningen i CUDA Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 3 av 4.

Hur lång tid tar lektionen ”Sekventiell adressering”?

De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.

Kan jag skriva och köra kod i den här CUDA Academy-lektionen?

Ja. Varje CUDA Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.

Alla lektioner i den här kursen

  1. Idén med ett reduktionsträd
  2. Eliminera warp-divergens
  3. Sekventiell adressering
  4. Slutlig reduktion över flera block
← Tillbaka till CUDA Academy