CUDA Academy · Pelajaran

Merancang Alur Pemrosesan

Tahap, buffer, dan aliran data

Pelajaran 1 dari 413 langkah

Merancang Alur Pemrosesan adalah pelajaran CUDA Academy gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar CUDA Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus CUDA Academy mencakup 4 pelajaran total.

Berpikir dalam Tahapan

Pipeline gambar yang nyata merupakan rangkaian tahapan: memuat, memburamkan, mempertajam, mengoreksi warna, lalu menyimpan. Setiap tahap adalah satu transformasi jelas yang dapat Anda pahami secara terpisah. 🧩

Data Mengalir Satu Arah

Piksel bergerak maju melalui pipeline: setiap tahap membaca keluaran sebelumnya dan menghasilkan masukan berikutnya. Aliran data satu arah ini membuat desain mudah diikuti.

Buffer Menyimpan Data Antartahap

Di antara dua tahap, Anda memerlukan tempat untuk menyimpan piksel. Buffer hanyalah larik perangkat yang ditulis oleh satu kernel dan dibaca oleh kernel berikutnya. Rencanakan satu buffer untuk setiap batas antartahap.

float* d_stage1;
cudaMalloc(&d_stage1, width * height * sizeof(float));

Dua Buffer secara Ping-Pong

Anda jarang memerlukan buffer baru untuk setiap tahap. Lakukan ping-pong di antara dua buffer: baca dari satu buffer, tulis ke buffer lainnya, lalu tukar. Dua buffer dapat melayani seluruh rangkaian.

std::swap(d_in, d_out);

Satu Kernel per Tahap untuk Saat Ini

Mulailah dengan satu kernel untuk setiap tahap. Ini adalah desain yang paling jelas dan paling mudah diverifikasi. Nanti Anda dapat menggabungkan beberapa tahap setelah masing-masing benar.

Petakan Piksel ke Thread

Pemetaan alaminya adalah satu thread untuk setiap piksel. Grid 2D mencakup lebar dan tinggi, sehingga setiap thread menangani tepat satu lokasi (x, y) untuk diproses.

int x = blockIdx.x * blockDim.x + threadIdx.x;
int y = blockIdx.y * blockDim.y + threadIdx.y;

Gunakan Indeks dengan Pitch Baris

Gambar disimpan baris demi baris. Ubah (x, y) menjadi offset datar dengan pengindeksan row-major agar setiap thread membaca piksel yang tepat.

int idx = y * width + x;

Lindungi Batas Gambar

Grid Anda dibulatkan ke atas, sehingga beberapa thread berada di luar gambar. Pemeriksaan batas sederhana mencegah thread tersebut menyentuh memori yang tidak semestinya.

if (x >= width || y >= height) return;

Pilih Bentuk Blok 2D

Blok seperti 16x16 atau 32x8 memberikan cakupan yang baik dan baris yang sesuai untuk warp. Jika memungkinkan, pilih bentuk blok 2D yang membagi gambar dengan rapi.

dim3 block(16, 16);
dim3 grid((width+15)/16, (height+15)/16);

Alokasikan Sekali, Gunakan Kembali Sesering Mungkin

Mengalokasikan memori perangkat membutuhkan biaya, jadi lakukan sekali sebelum perulangan. Gunakan kembali buffer yang sama untuk setiap bingkai, alih-alih melakukan malloc dan free setiap kali.

Buat Sketsa Sebelum Menulis Kode

Gambarkan terlebih dahulu tahap-tahap, buffer, dan panah di antaranya. Diagram aliran data yang jelas dapat menemukan kesalahan desain jauh sebelum kernel dijalankan. ✏️

Pemeriksaan Singkat

Anda memiliki rangkaian tahap. Bagaimana cara menghindari alokasi buffer baru untuk setiap tahap?

Rangkuman

Anda telah merancang alur pemrosesan sebagai tahapan satu arah yang dihubungkan oleh buffer, memetakan satu thread untuk setiap piksel dengan grid 2D, serta mempelajari cara menggunakan buffer secara bergantian dan membuat sketsa alurnya terlebih dahulu. 🎯

Gratis untuk memulai

Belajar C++ dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
30
Pelajaran
120

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Merancang Alur Pemrosesan” gratis?

Ya — teks lengkap “Merancang Alur Pemrosesan” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus CUDA Academy, upgrade ke CoddyKit PRO. Kursus CUDA Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Merancang Alur Pemrosesan”?

Tahap, buffer, dan aliran data Kamu berlatih CUDA Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai CUDA Academy?

Tidak diperlukan pengalaman sebelumnya. CUDA Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.

Berapa lama pelajaran “Merancang Alur Pemrosesan” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran CUDA Academy ini?

Ya. Setiap pelajaran CUDA Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Merancang Alur Pemrosesan
  2. Menggabungkan Filter ke dalam Satu Kernel
  3. Mengalirkan Tile untuk Gambar Besar
  4. Membuat Profil, Mengoptimalkan, Mengirimkan
← Kembali ke CUDA Academy