0Pricing
CUDA Academy · 강의

프로파일링, 최적화, 배포

Nsight 지표로 성능 개선 과정을 마무리합니다

프로파일링, 최적화, 배포은(는) CoddyKit의 무료 CUDA Academy 강의입니다. 이것은 4개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 CUDA Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. CUDA Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

추측하지 말고 측정하세요

최적화는 막연한 추측이 아니라 데이터에서 시작합니다. 단 한 줄이라도 바꾸기 전에 항상 먼저 프로파일링하여 실제로 시간이 어디에서 소요되는지 알아내세요. 🔍

타임라인부터 시작하세요

Nsight Systems를 열어 커널, 복사 작업, 공백을 포함한 전체 실행을 확인하세요. 타임라인에서 전송과 계산이 실제로 겹치는지 알 수 있습니다.

가장 오래 걸리는 커널을 찾으세요

보통 한 단계가 대부분의 시간을 차지합니다. 타임라인에서 가장 오래 실행되는 커널이 드러나며, 바로 그 부분부터 조정 작업을 시작해야 합니다.

Nsight Compute로 자세히 살펴보세요

가장 오래 걸리는 커널을 찾았다면 Nsight Compute로 전환하세요. 이 도구는 메모리 처리량, 정지 시간, 달성 점유율과 같은 커널별 측정값을 보여 줍니다.

루프라인을 읽으세요

루프라인은 커널이 메모리 제한인지 계산 제한인지 알려 줍니다. 이 한 가지 답에 따라 시도할 가치가 있는 최적화가 결정됩니다.

메모리 제한 커널 수정하기

메모리 제한 상태라면 코얼레싱, 공유 메모리 타일링, 벡터화된 로드를 적용하세요. 데이터를 더 빠르게 공급하는 것만이 속도를 높이는 방법입니다.

계산 제한 커널 수정하기

계산 제한 상태라면 루프 펼치기로 ILP를 높이고, 불필요한 수학 연산을 줄이거나, 더 낮은 정밀도로 전환하세요. 이 경우에는 산술 연산 장치가 한계입니다.

NVTX로 코드를 표시하세요

파이프라인 단계를 NVTX 범위로 감싸면 타임라인에 이름 없는 커널 대신 이름이 표시된 막대가 나타납니다. 읽기 쉬운 프로파일은 더 빠르게 디버깅할 수 있습니다.

nvtxRangePush("blur");
blurKernel<<<grid, block>>>(d_in, d_out);
nvtxRangePop();

한 번에 하나만 바꾸세요

최적화를 하나만 적용한 다음 다시 프로파일링하세요. 이 긴밀한 반복 과정을 통해 각 변경 사항의 효과를 확인하고, 두 가지 효과를 한꺼번에 추적하는 일을 막을 수 있습니다.

멈출 때를 아세요

커널이 루프라인 한계에 가까워지면 더 조정해도 얻는 것이 거의 없습니다. 수익 체감을 인식하고 다음 병목에 시간을 사용하세요.

검증한 후 출시하세요

출시하기 전에 기준 구현과 비교하여 정확성을 확인하고, 속도 향상이 안정적인지 점검하세요. 빠르지만 잘못된 파이프라인은 출시할 수 없습니다. 🚢

빠른 확인

Nsight Compute에서 가장 오래 걸리는 커널이 메모리 제한이라고 알려 줍니다. 어떤 수정을 먼저 시도해야 합니까?

복습

Nsight로 프로파일링하고, 루프라인을 읽어 커널을 분류하며, 한 번에 하나씩 대상에 맞는 수정을 적용하고, 빠르고 올바른 파이프라인을 출시하기 전에 검증하는 방법을 배웠습니다. 🏁

자주 묻는 질문

“프로파일링, 최적화, 배포” 강의는 무료인가요?

네 — “프로파일링, 최적화, 배포” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 CUDA Academy 강의 전체를 잠금 해제할 수 있습니다. CUDA Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

“프로파일링, 최적화, 배포”에서 뭘 배우나요?

Nsight 지표로 성능 개선 과정을 마무리합니다 브라우저에서 직접 실행하는 실습 코드로 CUDA Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

CUDA Academy을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 CUDA Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 4번째 강의입니다.

“프로파일링, 최적화, 배포” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 CUDA Academy 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 CUDA Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 처리 파이프라인 설계하기
  2. 필터를 하나의 커널로 융합하기
  3. 대형 이미지를 위한 타일 스트리밍
  4. 프로파일링, 최적화, 배포
← CUDA Academy(으)로 돌아가기