0Pricing
CUDA Academy · Pelajaran

Bangun Histogram

Gunakan operasi atomik dengan privatisasi memori bersama.

Bangun Histogram adalah pelajaran CUDA Academy gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar CUDA Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus CUDA Academy mencakup 4 pelajaran total.

Apa yang Dihitung Histogram

Histogram menghitung jumlah input yang masuk ke setiap bin. Banyak thread akan mencoba menambah bin yang sama, sehingga ini merupakan masalah operasi atomik. 📊

Pendekatan Naif

Setiap thread membaca satu elemen, menemukan bin-nya, lalu menambah bin tersebut. Tanpa perlindungan, bin yang populer akan kehilangan hitungan akibat kondisi balapan.

Versi Operasi Atomik Global

Solusi benar paling sederhana adalah satu atomicAdd untuk setiap elemen, langsung ke memori global. Cara ini berhasil, tetapi bin yang sering diakses membuat thread berjalan secara berurutan.

atomicAdd(&hist[bin], 1);

Masalah Persaingan

Ketika data terkumpul pada beberapa bin, ribuan thread menumpuk pada alamat yang sama. Persaingan tersebut dapat membuat operasi atomik global sangat lambat.

Privatisasi sebagai Solusi

Privatisasi memberikan setiap blok histogram pribadi di memori bersama yang cepat. Thread hanya saling berbenturan di dalam bloknya, bukan di seluruh grid.

Deklarasikan Histogram Bersama

Setiap blok mendeklarasikan larik bersama dengan ukuran sebanyak jumlah bin. Larik ini berada pada chip, sehingga operasi atomik di sana jauh lebih murah daripada operasi atomik global.

__shared__ int local[NBINS];

Langkah 1: Kosongkan Bin

Thread secara kooperatif menolkan histogram bersama, lalu memanggil __syncthreads agar tidak ada thread yang menghitung sebelum proses pengosongan selesai.

local[tid] = 0;
__syncthreads();

Langkah 2: Hitung Secara Lokal

Sekarang setiap thread secara atomik menambah bin-nya di memori bersama. atomicAdd-nya sama, tetapi diterapkan pada salinan di chip yang cepat, bukan pada memori global.

atomicAdd(&local[bin], 1);

Langkah 3: Gabungkan ke Global

Setelah penghalang sinkronisasi, thread menambahkan setiap bin bersama ke histogram global dengan satu atomicAdd per bin. Jumlah operasi atomik global jauh lebih sedikit daripada sebelumnya.

atomicAdd(&hist[i], local[i]);

Mengapa Ini Lebih Cepat

Operasi atomik pada memori bersama berlangsung cepat, dan operasi atomik global yang mahal kini dijalankan satu kali untuk setiap bin per blok, bukan satu kali untuk setiap elemen.

Perhatikan Jumlah Bin

Histogram pribadi harus muat di memori bersama. Jika jumlah bin terlalu banyak, bagi pemrosesannya menjadi beberapa lintasan atau gunakan kembali operasi atomik global.

Pemeriksaan Cepat

Satu pertanyaan tentang strategi histogram.

Rangkuman: Membuat Histogram

Anda membuat histogram dengan operasi atomik global, lalu mempercepatnya menggunakan privatisasi memori bersama: kosongkan, hitung secara lokal, lalu gabungkan. ✅

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Bangun Histogram” gratis?

Ya — teks lengkap “Bangun Histogram” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus CUDA Academy, upgrade ke CoddyKit PRO. Kursus CUDA Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Bangun Histogram”?

Gunakan operasi atomik dengan privatisasi memori bersama. Kamu berlatih CUDA Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai CUDA Academy?

Tidak diperlukan pengalaman sebelumnya. CUDA Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.

Berapa lama pelajaran “Bangun Histogram” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran CUDA Academy ini?

Ya. Setiap pelajaran CUDA Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Kondisi Balapan pada GPU
  2. atomicAdd dan Rekan-rekannya
  3. Bangun Histogram
  4. Operasi Atomik Kustom dengan atomicCAS
← Kembali ke CUDA Academy