CUDA Academy · 강의

내적을 타일로 나누기

각 단계에서 A와 B의 하위 타일을 로드합니다.

레슨 2/413개 단계

내적을 타일로 나누기은(는) CoddyKit의 무료 CUDA Academy 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 CUDA Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. CUDA Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

타일링의 개념

타일링은 행렬을 빠른 칩 내 메모리에 들어갈 만큼 작은 정사각형 타일로 나눕니다. 스레드들은 협력하여 타일을 한 번 로드한 뒤 여러 번 재사용합니다.

공유 메모리를 사용하는 이유

타일은 블록의 모든 스레드가 볼 수 있는 __shared__ 메모리에 저장됩니다. 이 메모리를 읽는 것은 전역 메모리를 계속 읽는 것보다 훨씬 빠릅니다. ⚡

__shared__ float As[TILE][TILE];
__shared__ float Bs[TILE][TILE];

블록 하나, 출력 타일 하나

각 블록은 출력 C에서 TILE × TILE 크기의 한 영역을 담당합니다. 블록의 스레드들이 협력하여 이 영역 전체를 함께 계산합니다.

타일 크기와 블록 크기 맞추기

TILE을 블록의 너비와 같게 정하며, 보통 16 또는 32를 사용합니다. 그러면 각 스레드가 각 타일의 원소를 정확히 하나씩 로드합니다.

#define TILE 16
dim3 threads(TILE, TILE);

스레드를 타일 슬롯에 매핑하기

타일 내부에서 스레드의 슬롯은 단순히 threadIdx입니다. 전역 행과 열은 여전히 블록 인덱스와 스레드 인덱스에서 계산합니다.

int ty = threadIdx.y, tx = threadIdx.x;
int row = blockIdx.y*TILE + ty;
int col = blockIdx.x*TILE + tx;

A의 타일 로드하기

각 스레드는 A의 현재 타일에서 원소 하나를 공유 메모리로 복사합니다. 블록 전체가 협력하여 A의 TILE × TILE 크기 영역을 준비합니다.

As[ty][tx] = A[row*N + (phase*TILE + tx)];

B의 타일 로드하기

동시에 각 스레드는 B의 타일에서 원소 하나를 로드합니다. 이제 두 타일이 모두 칩 내에 있으므로 빠르게 반복해서 읽을 수 있습니다.

Bs[ty][tx] = B[(phase*TILE + ty)*N + col];

계산 전 동기화

모든 스레드가 로드를 끝낸 후 타일을 읽도록 __syncthreads()를 호출합니다. 이를 생략하면 잘못된 결과가 나옵니다.

__syncthreads();

타일에서 계산하기

이제 각 스레드는 타일을 대상으로 짧은 반복문을 실행하며 공유 메모리만 읽습니다. 이러한 읽기는 전역 메모리 읽기보다 훨씬 저렴합니다.

for (int k = 0; k < TILE; ++k)
  sum += As[ty][k] * Bs[k][tx];

재사용의 효과

로드된 각 값은 한 번이 아니라 TILE개의 스레드가 사용합니다. 이러한 데이터 재사용이 타일 기반 행렬 곱셈이 빠른 핵심 이유입니다.

타일 하나로는 부족합니다

타일 하나로는 내적의 일부만 처리할 수 있습니다. 여러 단계에 걸쳐 로드-동기화-계산 과정을 반복하며, 다음 레슨에서 이를 다룹니다.

빠른 확인

공유 타일을 사용할 때 단계의 순서를 떠올려 보세요.

복습

A와 B의 타일을 공유 메모리에 준비하고 동기화한 다음, 비용이 낮은 칩 내 메모리 읽기로 계산했습니다. 핵심은 재사용입니다. 다음은 단계 처리입니다. 🧱

무료로 시작

AI 튜터와 함께 C++을(를) 배우세요 — 무료

브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.

코스
30
레슨
120

자주 묻는 질문

“내적을 타일로 나누기” 강의는 무료인가요?

네 — “내적을 타일로 나누기” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 CUDA Academy 강의 전체를 잠금 해제할 수 있습니다. CUDA Academy 강의에는 총 4개의 강의가 포함되어 있습니다.

“내적을 타일로 나누기”에서 뭘 배우나요?

각 단계에서 A와 B의 하위 타일을 로드합니다. 브라우저에서 직접 실행하는 실습 코드로 CUDA Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

CUDA Academy을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 CUDA Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.

“내적을 타일로 나누기” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 CUDA Academy 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 CUDA Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 단순한 행렬 곱셈 커널
  2. 내적을 타일로 나누기
  3. 타일 단계 반복하기
  4. 성능 향상 측정하기
← CUDA Academy(으)로 돌아가기