Terikat Komputasi versus Terikat Memori
Baca roofline untuk merencanakan perbaikan.
Terikat Komputasi versus Terikat Memori adalah pelajaran CUDA Academy gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar CUDA Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus CUDA Academy mencakup 4 pelajaran total.
Dua Jenis Batasan
Setiap kernel menabrak salah satu dari dua batas. Kernel tersebut mungkin terbatas komputasi, dibatasi oleh perhitungan, atau terbatas memori, dibatasi oleh perpindahan data. ⚖️
Definisi Terbatas Komputasi
Kernel yang terbatas komputasi membuat unit perhitungan tetap sibuk dan jarang menunggu memori. Batasnya adalah laju pemrosesan aritmetika mentah.
Definisi Terbatas Memori
Kernel yang terbatas memori menghabiskan waktunya untuk menunggu data. Inti pemrosesan menganggur sementara byte masuk perlahan dari memori global.
Intensitas Aritmetika
Rasio kuncinya adalah intensitas aritmetika: jumlah operasi matematika yang dilakukan untuk setiap byte yang dimuat. Intensitas tinggi cenderung terbatas komputasi, sedangkan intensitas rendah cenderung terbatas memori.
Gambaran Roofline
Pada grafik roofline, kernel berintensitas rendah mencapai batas memori yang miring, sedangkan kernel berintensitas tinggi mencapai batas komputasi yang datar.
Mengapa Diagnosis Penting
Memperbaiki batas yang salah hanya membuang usaha. Menambahkan perhitungan pada kernel yang terbatas memori tidak mengubah apa pun; Anda harus mengurangi lalu lintas data.
Memperbaiki Kernel yang Terbatas Memori
Untuk mempercepat kernel yang terbatas memori, gabungkan akses, gunakan ulang data di memori bersama, dan simpan nilai dalam cache agar lebih sedikit data yang perlu dibaca.
Memperbaiki Kernel yang Terbatas Komputasi
Untuk pekerjaan yang terbatas komputasi, tingkatkan paralelisme, gunakan perhitungan yang lebih cepat, atau manfaatkan inti tensor untuk melampaui batas komputasi.
Sebagian Besar Kernel Terbatas Memori
Dalam praktiknya, sebagian besar kernel CUDA terbatas memori. Bandwidth, bukan aritmetika, biasanya merupakan sumber daya yang langka.
Biarkan Pembuat Profil yang Menentukan
Jangan menebak batasnya. Roofline dalam Nsight Compute menempatkan kernel Anda di bawah batas yang tepat secara otomatis.
Uji Sederhana dalam Pikiran
Ajukan satu pertanyaan: mana yang lebih dekat dengan kapasitas puncak, inti pemrosesan atau jalur memori? Apa pun yang jenuh menunjukkan jenis batasan Anda.
Pemeriksaan Singkat
Sebuah kernel memiliki intensitas aritmetika yang sangat rendah.
Rangkuman
Diagnosis batasnya terlebih dahulu: kernel yang terbatas memori memerlukan lebih sedikit lalu lintas, sedangkan kernel yang terbatas komputasi memerlukan lebih banyak perhitungan. Roofline memberi tahu Anda yang mana. 👏
Belajar C++ dengan tutor AI — gratis
Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.
- Kursus
- 30
- Pelajaran
- 120
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Terikat Komputasi versus Terikat Memori” gratis?
Ya — teks lengkap “Terikat Komputasi versus Terikat Memori” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus CUDA Academy, upgrade ke CoddyKit PRO. Kursus CUDA Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Terikat Komputasi versus Terikat Memori”?
Baca roofline untuk merencanakan perbaikan. Kamu berlatih CUDA Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai CUDA Academy?
Tidak diperlukan pengalaman sebelumnya. CUDA Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.
Berapa lama pelajaran “Terikat Komputasi versus Terikat Memori” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran CUDA Academy ini?
Ya. Setiap pelajaran CUDA Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Tampilan Linimasa di Nsight Systems
- Metrik Kernel di Nsight Compute
- Terikat Komputasi versus Terikat Memori
- Beri Anotasi pada Kode dengan NVTX