CUDA Academy · 강의

레지스터 압박과 스필

재사용과 점유율 사이의 균형을 맞춥니다

레슨 4/413개 단계

레지스터 압박과 스필은(는) CoddyKit의 무료 CUDA Academy 강의입니다. 이것은 4개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 CUDA Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. CUDA Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

레지스터는 소중합니다

레지스터는 스레드가 사용할 수 있는 가장 빠른 저장 공간이지만, 각 SM이 보유한 수량에는 한계가 있습니다. 커널이 레지스터를 얼마나 많이 사용하는지를 레지스터 압박이라고 합니다.

공유되는 고정된 공간

상주하는 모든 스레드는 SM마다 하나씩 있는 레지스터 파일에서 공간을 할당받습니다. 스레드 하나에 필요한 레지스터가 많을수록 동시에 상주할 수 있는 스레드 수는 줄어듭니다.

압박이 점유율을 낮춥니다

레지스터 사용량이 높으면 SM에 들어갈 수 있는 워프 수가 직접 제한됩니다. 이렇게 점유율이 낮아지면 하드웨어가 지연 시간을 숨길 작업이 부족해질 수 있습니다.

스필이란 무엇인가

스레드에 필요한 레지스터가 부족하면 컴파일러가 여분의 값을 밖으로 옮깁니다. 이 오버플로를 느린 메모리로 내보내는 레지스터 스필이라고 합니다.

스필은 로컬 메모리에 저장됩니다

스필된 값은 오프칩 DRAM에 있는 로컬 메모리로 이동합니다. 스필이 발생할 때마다 사용 가능한 레지스터 접근이 느린 왕복 메모리 접근으로 대체됩니다.

레지스터 수 확인하기

컴파일러에 사용량을 보고하도록 요청하십시오. nvcc에 --ptxas-options=-v를 추가하면 각 커널의 스레드당 레지스터 수와 스필 바이트가 출력됩니다.

nvcc --ptxas-options=-v kernel.cu

스필 수치 읽기

보고서에는 스필 저장과 스필 읽기가 나열됩니다. 0이 아닌 스필 수는 커널이 느린 로컬 메모리 트래픽을 감당하고 있다는 경고 신호입니다.

스레드당 레지스터 수 제한하기

컴파일할 때 상한을 설정할 수 있습니다. --maxrregcount 플래그는 스레드당 레지스터 수를 제한하여, 약간의 속도를 희생하는 대신 점유율을 높입니다.

nvcc --maxrregcount=32 kernel.cu

__launch_bounds__로 힌트 주기

커널별 힌트를 사용하는 편이 더 나은 경우가 많습니다. __launch_bounds__는 컴파일러에 블록 크기를 알려 주므로, 원하는 점유율에 맞춰 레지스터를 배분할 수 있습니다.

__global__ void __launch_bounds__(256)
myKernel() { /* ... */ }

활성 값 집합 줄이기

대개 한 번에 보유하는 값의 수를 줄이는 것만으로도 충분합니다. 계산 비용이 낮은 결과를 다시 계산하거나 변수의 범위를 좁히면 활성 상태로 유지되는 레지스터 수가 줄어듭니다.

재사용과 점유율의 균형 맞추기

ILP와 반복문 펼치기는 압박을 높이는 반면, 제한을 설정하면 점유율이 높아집니다. 가장 빠르게 실행되는 균형을 찾는 것이 중요하며, 그 지점을 알려 줄 수 있는 것은 프로파일러뿐입니다.

빠른 확인

커널의 레지스터가 부족해지면 값은 어디로 이동합니까?

복습: 압박을 관리하십시오

높은 레지스터 압박이 점유율을 낮추고 느린 DRAM으로 스필을 일으킬 수 있다는 것을 배웠습니다. 사용량을 측정하고 레지스터 수를 제한한 뒤 프로파일러의 안내를 따르십시오. 🎯

무료로 시작

AI 튜터와 함께 C++을(를) 배우세요 — 무료

브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.

코스
30
레슨
120

자주 묻는 질문

“레지스터 압박과 스필” 강의는 무료인가요?

네 — “레지스터 압박과 스필” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 CUDA Academy 강의 전체를 잠금 해제할 수 있습니다. CUDA Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

“레지스터 압박과 스필”에서 뭘 배우나요?

재사용과 점유율 사이의 균형을 맞춥니다 브라우저에서 직접 실행하는 실습 코드로 CUDA Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

CUDA Academy을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 CUDA Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 4번째 강의입니다.

“레지스터 압박과 스필” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 CUDA Academy 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 CUDA Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 명령어 수준 병렬성
  2. #pragma unroll로 반복문 펼치기
  3. float4를 사용한 벡터화된 로드
  4. 레지스터 압박과 스필
← CUDA Academy(으)로 돌아가기