Metrik Kernel di Nsight Compute
Data laju pemrosesan, kemacetan, dan roofline.
Metrik Kernel di Nsight Compute adalah pelajaran CUDA Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar CUDA Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus CUDA Academy mencakup 4 pelajaran total.
Memperbesar Satu Kernel
Nsight Compute adalah mikroskop untuk satu kernel. Alat ini mengumpulkan metrik perangkat keras yang mendalam agar Anda dapat melihat dengan tepat penyebab kelambatannya. 🔬
Cara Menjalankannya
Anda membuat profil kernel dengan ncu melalui baris perintah. Alat ini menjalankan ulang kernel berkali-kali untuk mengumpulkan penghitung terperinci.
ncu -o report ./my_cuda_appMetrik Laju Pemrosesan
Hal pertama yang perlu dibaca adalah laju pemrosesan: seberapa sibuk unit komputasi dan jalur memori, yang ditampilkan sebagai persentase dari kapasitas puncaknya.
Membaca Kemacetan Warp
Kemacetan adalah keadaan ketika warp tidak dapat membuat kemajuan pada siklus ini. Nsight Compute mengelompokkan kemacetan berdasarkan penyebabnya agar Anda tahu apa yang harus diperbaiki.
Kemacetan Memori
Jika sebagian besar kemacetan menunjukkan memori, kernel Anda sedang menunggu data. Solusinya adalah pola akses atau penggunaan ulang yang lebih baik, bukan menambah perhitungan.
Okupansi Aktual
Okupansi aktual menunjukkan jumlah warp yang benar-benar aktif dibandingkan dengan jumlah maksimumnya. Nilai rendah sering berarti terlalu sedikit warp untuk menyembunyikan latensi.
Grafik Roofline
Roofline memetakan kernel Anda terhadap batas perangkat keras. Posisi titik menunjukkan apakah komputasi atau memori yang menjadi batasnya.
Analisis Terpandu
Nsight Compute menulis rekomendasi dalam bahasa yang mudah dipahami. Alat ini menunjukkan hambatan terbesar agar Anda tidak perlu menebak terlebih dahulu.
Tingkat Keberhasilan Cache
Penghitung untuk cache L1 dan L2 menunjukkan seberapa sering pembacaan menemukan data di cache. Tingkat keberhasilan yang lebih tinggi berarti lebih sedikit perjalanan ke memori global yang lambat.
Membandingkan Dua Versi
Anda dapat membandingkan perbedaan dua laporan secara berdampingan. Dengan begitu, terlihat jelas apakah perubahan terbaru Anda benar-benar memperbaiki metrik.
Menjalankan Ulang, Jadi Lambat
Karena kernel dijalankan ulang, biaya tambahan pembuatan profil cukup tinggi. Gunakan alat ini pada satu kernel setiap kali, bukan sebagai proses biasa.
Pemeriksaan Singkat
Laporan kernel Anda menunjukkan sebagian besar kemacetan warp yang berkaitan dengan memori.
Rangkuman
Nsight Compute mengungkap metrik satu kernel: laju pemrosesan, kemacetan, okupansi, dan roofline. Gunakan alat ini untuk memastikan dengan tepat apa yang perlu dioptimalkan. 👏
Belajar C++ dengan tutor AI — gratis
Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.
- Kursus
- 30
- Pelajaran
- 120
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Metrik Kernel di Nsight Compute” gratis?
Ya — teks lengkap “Metrik Kernel di Nsight Compute” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus CUDA Academy, upgrade ke CoddyKit PRO. Kursus CUDA Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Metrik Kernel di Nsight Compute”?
Data laju pemrosesan, kemacetan, dan roofline. Kamu berlatih CUDA Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai CUDA Academy?
Tidak diperlukan pengalaman sebelumnya. CUDA Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.
Berapa lama pelajaran “Metrik Kernel di Nsight Compute” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran CUDA Academy ini?
Ya. Setiap pelajaran CUDA Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Tampilan Linimasa di Nsight Systems
- Metrik Kernel di Nsight Compute
- Terikat Komputasi versus Terikat Memori
- Beri Anotasi pada Kode dengan NVTX