내적을 타일로 나누기
각 단계에서 A와 B의 하위 타일을 로드합니다.
내적을 타일로 나누기은(는) CoddyKit의 무료 CUDA Academy 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 CUDA Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. CUDA Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
타일링의 개념
타일링은 행렬을 빠른 칩 내 메모리에 들어갈 만큼 작은 정사각형 타일로 나눕니다. 스레드들은 협력하여 타일을 한 번 로드한 뒤 여러 번 재사용합니다.
공유 메모리를 사용하는 이유
타일은 블록의 모든 스레드가 볼 수 있는 __shared__ 메모리에 저장됩니다. 이 메모리를 읽는 것은 전역 메모리를 계속 읽는 것보다 훨씬 빠릅니다. ⚡
__shared__ float As[TILE][TILE];
__shared__ float Bs[TILE][TILE];블록 하나, 출력 타일 하나
각 블록은 출력 C에서 TILE × TILE 크기의 한 영역을 담당합니다. 블록의 스레드들이 협력하여 이 영역 전체를 함께 계산합니다.
타일 크기와 블록 크기 맞추기
TILE을 블록의 너비와 같게 정하며, 보통 16 또는 32를 사용합니다. 그러면 각 스레드가 각 타일의 원소를 정확히 하나씩 로드합니다.
#define TILE 16
dim3 threads(TILE, TILE);스레드를 타일 슬롯에 매핑하기
타일 내부에서 스레드의 슬롯은 단순히 threadIdx입니다. 전역 행과 열은 여전히 블록 인덱스와 스레드 인덱스에서 계산합니다.
int ty = threadIdx.y, tx = threadIdx.x;
int row = blockIdx.y*TILE + ty;
int col = blockIdx.x*TILE + tx;A의 타일 로드하기
각 스레드는 A의 현재 타일에서 원소 하나를 공유 메모리로 복사합니다. 블록 전체가 협력하여 A의 TILE × TILE 크기 영역을 준비합니다.
As[ty][tx] = A[row*N + (phase*TILE + tx)];B의 타일 로드하기
동시에 각 스레드는 B의 타일에서 원소 하나를 로드합니다. 이제 두 타일이 모두 칩 내에 있으므로 빠르게 반복해서 읽을 수 있습니다.
Bs[ty][tx] = B[(phase*TILE + ty)*N + col];계산 전 동기화
모든 스레드가 로드를 끝낸 후 타일을 읽도록 __syncthreads()를 호출합니다. 이를 생략하면 잘못된 결과가 나옵니다.
__syncthreads();타일에서 계산하기
이제 각 스레드는 타일을 대상으로 짧은 반복문을 실행하며 공유 메모리만 읽습니다. 이러한 읽기는 전역 메모리 읽기보다 훨씬 저렴합니다.
for (int k = 0; k < TILE; ++k)
sum += As[ty][k] * Bs[k][tx];재사용의 효과
로드된 각 값은 한 번이 아니라 TILE개의 스레드가 사용합니다. 이러한 데이터 재사용이 타일 기반 행렬 곱셈이 빠른 핵심 이유입니다.
타일 하나로는 부족합니다
타일 하나로는 내적의 일부만 처리할 수 있습니다. 여러 단계에 걸쳐 로드-동기화-계산 과정을 반복하며, 다음 레슨에서 이를 다룹니다.
빠른 확인
공유 타일을 사용할 때 단계의 순서를 떠올려 보세요.
복습
A와 B의 타일을 공유 메모리에 준비하고 동기화한 다음, 비용이 낮은 칩 내 메모리 읽기로 계산했습니다. 핵심은 재사용입니다. 다음은 단계 처리입니다. 🧱
AI 튜터와 함께 C++을(를) 배우세요 — 무료
브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.
- 코스
- 30
- 레슨
- 120
자주 묻는 질문
“내적을 타일로 나누기” 강의는 무료인가요?
네 — “내적을 타일로 나누기” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 CUDA Academy 강의 전체를 잠금 해제할 수 있습니다. CUDA Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“내적을 타일로 나누기”에서 뭘 배우나요?
각 단계에서 A와 B의 하위 타일을 로드합니다. 브라우저에서 직접 실행하는 실습 코드로 CUDA Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
CUDA Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 CUDA Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.
“내적을 타일로 나누기” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 CUDA Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 CUDA Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 단순한 행렬 곱셈 커널
- 내적을 타일로 나누기
- 타일 단계 반복하기
- 성능 향상 측정하기