CUDA Academy · Pelajaran

Metrik Kernel di Nsight Compute

Data laju pemrosesan, kemacetan, dan roofline.

Pelajaran 2 dari 413 langkah

Metrik Kernel di Nsight Compute adalah pelajaran CUDA Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar CUDA Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus CUDA Academy mencakup 4 pelajaran total.

Memperbesar Satu Kernel

Nsight Compute adalah mikroskop untuk satu kernel. Alat ini mengumpulkan metrik perangkat keras yang mendalam agar Anda dapat melihat dengan tepat penyebab kelambatannya. 🔬

Cara Menjalankannya

Anda membuat profil kernel dengan ncu melalui baris perintah. Alat ini menjalankan ulang kernel berkali-kali untuk mengumpulkan penghitung terperinci.

ncu -o report ./my_cuda_app

Metrik Laju Pemrosesan

Hal pertama yang perlu dibaca adalah laju pemrosesan: seberapa sibuk unit komputasi dan jalur memori, yang ditampilkan sebagai persentase dari kapasitas puncaknya.

Membaca Kemacetan Warp

Kemacetan adalah keadaan ketika warp tidak dapat membuat kemajuan pada siklus ini. Nsight Compute mengelompokkan kemacetan berdasarkan penyebabnya agar Anda tahu apa yang harus diperbaiki.

Kemacetan Memori

Jika sebagian besar kemacetan menunjukkan memori, kernel Anda sedang menunggu data. Solusinya adalah pola akses atau penggunaan ulang yang lebih baik, bukan menambah perhitungan.

Okupansi Aktual

Okupansi aktual menunjukkan jumlah warp yang benar-benar aktif dibandingkan dengan jumlah maksimumnya. Nilai rendah sering berarti terlalu sedikit warp untuk menyembunyikan latensi.

Grafik Roofline

Roofline memetakan kernel Anda terhadap batas perangkat keras. Posisi titik menunjukkan apakah komputasi atau memori yang menjadi batasnya.

Analisis Terpandu

Nsight Compute menulis rekomendasi dalam bahasa yang mudah dipahami. Alat ini menunjukkan hambatan terbesar agar Anda tidak perlu menebak terlebih dahulu.

Tingkat Keberhasilan Cache

Penghitung untuk cache L1 dan L2 menunjukkan seberapa sering pembacaan menemukan data di cache. Tingkat keberhasilan yang lebih tinggi berarti lebih sedikit perjalanan ke memori global yang lambat.

Membandingkan Dua Versi

Anda dapat membandingkan perbedaan dua laporan secara berdampingan. Dengan begitu, terlihat jelas apakah perubahan terbaru Anda benar-benar memperbaiki metrik.

Menjalankan Ulang, Jadi Lambat

Karena kernel dijalankan ulang, biaya tambahan pembuatan profil cukup tinggi. Gunakan alat ini pada satu kernel setiap kali, bukan sebagai proses biasa.

Pemeriksaan Singkat

Laporan kernel Anda menunjukkan sebagian besar kemacetan warp yang berkaitan dengan memori.

Rangkuman

Nsight Compute mengungkap metrik satu kernel: laju pemrosesan, kemacetan, okupansi, dan roofline. Gunakan alat ini untuk memastikan dengan tepat apa yang perlu dioptimalkan. 👏

Gratis untuk memulai

Belajar C++ dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
30
Pelajaran
120

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Metrik Kernel di Nsight Compute” gratis?

Ya — teks lengkap “Metrik Kernel di Nsight Compute” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus CUDA Academy, upgrade ke CoddyKit PRO. Kursus CUDA Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Metrik Kernel di Nsight Compute”?

Data laju pemrosesan, kemacetan, dan roofline. Kamu berlatih CUDA Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai CUDA Academy?

Tidak diperlukan pengalaman sebelumnya. CUDA Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.

Berapa lama pelajaran “Metrik Kernel di Nsight Compute” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran CUDA Academy ini?

Ya. Setiap pelajaran CUDA Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Tampilan Linimasa di Nsight Systems
  2. Metrik Kernel di Nsight Compute
  3. Terikat Komputasi versus Terikat Memori
  4. Beri Anotasi pada Kode dengan NVTX
← Kembali ke CUDA Academy