CUDA Academy · Pelajaran

Paralelisme Tingkat Instruksi

Berikan setiap thread lebih banyak pekerjaan independen.

Pelajaran 1 dari 413 langkah

Paralelisme Tingkat Instruksi adalah pelajaran CUDA Academy gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar CUDA Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus CUDA Academy mencakup 4 pelajaran total.

Lebih dari Satu Hal Sekaligus

Di dalam satu thread, GPU dapat menjalankan beberapa instruksi independen secara bersamaan. Tumpang tindih ini disebut instruction-level parallelism, atau ILP.

Mengapa ILP Penting

Operasi memori dan matematika memerlukan banyak siklus untuk selesai. Dengan pekerjaan independen yang cukup pada setiap thread, perangkat keras menyembunyikan latency tersebut alih-alih berhenti menunggu.

Ketergantungan Menghambat Tumpang Tindih

Jika setiap baris memerlukan hasil dari baris sebelumnya, tidak ada yang dapat berjalan tumpang tindih. dependency chain yang panjang memaksa thread menunggu langkah demi langkah.

float a = x * 2.0f;
float b = a + 1.0f; // waits on a
float c = b * b;    // waits on b

Alur Kerja Independen Mengalir Bebas

Ketika operasi tidak saling bergantung, penjadwal dapat menerbitkannya secara berurutan. Memecah rantai menjadi bagian independent adalah inti ILP.

float a = x * 2.0f;
float b = y * 2.0f; // does not need a

Satu Thread, Banyak Elemen

Cara sederhana untuk menambahkan ILP adalah membuat setiap thread memproses beberapa elemen. Penjumlahan yang terpisah menjadi pekerjaan independent yang dapat dijalankan tumpang tindih oleh perangkat keras.

out[i]     = in[i]     + 1.0f;
out[i + n] = in[i + n] + 1.0f;

Gunakan Beberapa Akumulator

Menjumlahkan ke satu variabel menciptakan rantai. Membaginya ke beberapa accumulators memungkinkan penjumlahan independen berjalan secara paralel sebelum digabungkan.

float s0 = 0, s1 = 0;
s0 += a[i];
s1 += a[i + 1];

Gabungkan di Akhir

Setelah perulangan, gabungkan accumulators sementara Anda menjadi jawaban akhir. Ketergantungan tunggal kini terjadi sekali, bukan pada setiap iterasi.

float total = s0 + s1;

ILP Mengorbankan Register

Menyimpan lebih banyak nilai per thread menggunakan lebih banyak register. Sedikit tambahan tekanan register biasanya sepadan dengan latensi yang disembunyikan, tetapi waspadalah terhadap spill.

Dua Cara Menyembunyikan Latensi

GPU menyembunyikan jeda dengan banyak thread aktif dan ILP di dalam setiap thread. ILP yang kuat dapat membuat SM tetap sibuk meskipun okupansinya sedang.

Temukan Rantai yang Panjang

Untuk meningkatkan ILP, carilah dependency chain terpanjang dalam perulangan bagian dalam Anda. Susun ulang menjadi bagian yang lebih pendek dan independen untuk menampilkan lebih banyak paralelisme.

Jangan Berlebihan

Terlalu banyak nilai independen dapat menyebabkan register tumpah dan memperlambat program. Tingkatkan ILP secara bertahap dan biarkan profiler memastikan setiap langkah benar-benar membantu.

Pemeriksaan Cepat

Reduksi Anda menjumlahkan ke satu variabel pada setiap iterasi. Bagaimana Anda menambahkan ILP?

Rangkuman: Tumpang Tindih di Dalam Thread

Anda melihat bahwa ILP menyembunyikan latensi dengan menjalankan instruksi independen secara bersamaan. Pecahkan rantai ketergantungan dan gunakan beberapa akumulator, tetapi perhatikan tekanan register. 🚀

Gratis untuk memulai

Belajar C++ dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
30
Pelajaran
120

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Paralelisme Tingkat Instruksi” gratis?

Ya — teks lengkap “Paralelisme Tingkat Instruksi” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus CUDA Academy, upgrade ke CoddyKit PRO. Kursus CUDA Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Paralelisme Tingkat Instruksi”?

Berikan setiap thread lebih banyak pekerjaan independen. Kamu berlatih CUDA Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai CUDA Academy?

Tidak diperlukan pengalaman sebelumnya. CUDA Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.

Berapa lama pelajaran “Paralelisme Tingkat Instruksi” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran CUDA Academy ini?

Ya. Setiap pelajaran CUDA Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Paralelisme Tingkat Instruksi
  2. Uraikan Perulangan dengan #pragma unroll
  3. Pemuatan Tervektorisasi dengan float4
  4. Tekanan Register dan Spill
← Kembali ke CUDA Academy