CUDA Academy · Les

Registerdruk en spills

Hergebruik afwegen tegen occupancy

Les 4 van 413 stappen

Registerdruk en spills is een gratis CUDA Academy-les op CoddyKit. Dit is les 4 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject CUDA Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus CUDA Academy bevat in totaal 4 lessen.

Registers zijn kostbaar

Registers zijn de snelste opslag waarover een thread beschikt, maar elke SM heeft er slechts een beperkt aantal. Hoe intensief een kernel ze gebruikt, heet registerdruk.

Eén gedeelde, vaste voorraad

Elke actieve thread gebruikt registers uit één registerbestand per SM. Hoe meer registers elke thread nodig heeft, hoe minder threads tegelijk actief kunnen blijven.

Druk verlaagt de bezettingsgraad

Intensief registergebruik beperkt rechtstreeks hoeveel warps op een SM passen. Door die daling van de bezettingsgraad kan de hardware te weinig werk hebben om latentie te verbergen.

Wat registerspill betekent

Wanneer een thread meer registers nodig heeft dan er beschikbaar zijn, verplaatst de compiler extra waarden naar buiten. Deze overloop is een registerspill naar tragere geheugens.

Spills komen in lokaal geheugen terecht

Gespilde waarden gaan naar lokaal geheugen, dat zich in DRAM buiten de chip bevindt. Elke spill vervangt een snelle registertoegang door een trage heen-en-terugbewerking.

Bekijk uw aantal registers

Vraag de compiler om het gebruik te rapporteren. Als u --ptxas-options=-v toevoegt aan nvcc, worden het aantal registers per thread en eventuele spillbytes voor elke kernel afgedrukt.

nvcc --ptxas-options=-v kernel.cu

Lees de spillcijfers

Het rapport vermeldt spill-opslagbewerkingen en -laadbewerkingen. Elk niet-nul spill-aantal is een waarschuwing dat uw kernel betaalt voor traag verkeer naar lokaal geheugen.

Beperk registers per thread

U kunt tijdens het compileren een bovengrens instellen. De vlag --maxrregcount beperkt het aantal registers per thread, in ruil voor een hogere bezettingsgraad.

nvcc --maxrregcount=32 kernel.cu

Geef een aanwijzing met __launch_bounds__

Een aanwijzing per kernel is vaak beter. __launch_bounds__ vertelt de compiler hoe groot uw blok is, zodat deze registers kan begroten voor de gewenste bezettingsgraad.

__global__ void __launch_bounds__(256)
myKernel() { /* ... */ }

Verklein de actieve verzameling

Vaak kunt u eenvoudig minder waarden tegelijk vasthouden. Een goedkope uitkomst opnieuw berekenen of de scope van een variabele verkleinen, vermindert het aantal registers dat actief blijft.

Breng hergebruik en bezettingsgraad in balans

ILP en unrolling verhogen de registerdruk, terwijl begrenzingen de bezettingsgraad verhogen. De kunst is de balans te vinden waarmee u het snelst werkt; alleen de profiler kan u vertellen waar die ligt.

Korte controle

Waar gaan waarden naartoe wanneer een kernel geen registers meer heeft?

Samenvatting: houd de druk onder controle

U hebt geleerd dat een hoge registerdruk de bezettingsgraad verlaagt en spills naar trage DRAM kan veroorzaken. Meet het gebruik, beperk het aantal registers en laat de profiler u sturen. 🎯

Gratis beginnen

Leer C++ met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
30
Lessen
120

Veelgestelde vragen

Is de les “Registerdruk en spills” gratis?

Ja — de volledige tekst van “Registerdruk en spills” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus CUDA Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus CUDA Academy bevat in totaal 4 lessen.

Wat leer ik in “Registerdruk en spills”?

Hergebruik afwegen tegen occupancy Je oefent met CUDA Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met CUDA Academy te beginnen?

Ervaring vooraf is niet nodig. CUDA Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 4.

Hoe lang duurt de les “Registerdruk en spills”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over CUDA Academy?

Ja. Elke les over CUDA Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Parallellisme op instructieniveau
  2. Loops uitrollen met #pragma unroll
  3. Gevectoriseerde loads met float4
  4. Registerdruk en spills
← Terug naar CUDA Academy