0Pricing
CUDA Academy · Lekcja

Metryki kerneli w Nsight Compute

Analizować przepustowość, przestoje i dane roofline.

Metryki kerneli w Nsight Compute to bezpłatna lekcja CUDA Academy na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej CUDA Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs CUDA Academy zawiera 4 lekcji w sumie.

Przybliżenie pojedynczego kernela

Nsight Compute to mikroskop do badania pojedynczego kernela. Zbiera szczegółowe metryki sprzętowe, dzięki czemu możesz dokładnie zobaczyć, dlaczego kernel działa wolno. 🔬

Jak uruchomić narzędzie

Profilujesz kernel za pomocą ncu w wierszu poleceń. Narzędzie wielokrotnie odtwarza wykonanie kernela, aby zebrać szczegółowe liczniki.

ncu -o report ./my_cuda_app

Metryki przepustowości

Pierwszą rzeczą, którą należy odczytać, jest przepustowość: stopień zajętości jednostek obliczeniowych i ścieżek pamięci, przedstawiony jako procent ich wartości szczytowej.

Odczytywanie zatrzymań warpów

Zatrzymanie to sytuacja, w której warp nie może zrobić postępu w bieżącym cyklu. Nsight Compute grupuje zatrzymania według przyczyny, dzięki czemu wiesz, co należy poprawić.

Zatrzymania pamięci

Jeśli większość zatrzymań dotyczy pamięci, kernel czeka na dane. Rozwiązaniem są lepsze wzorce dostępu lub ponowne wykorzystanie danych, a nie dodatkowe obliczenia.

Osiągnięte wykorzystanie zasobów

Osiągnięte wykorzystanie zasobów pokazuje, ile warpów było faktycznie aktywnych w porównaniu z maksimum. Niskie wartości często oznaczają zbyt mało warpów, aby ukryć opóźnienia.

Wykres roofline

Roofline porównuje Twój kernel z ograniczeniami sprzętowymi. Położenie punktu wskazuje, czy ograniczeniem są obliczenia, czy pamięć.

Analiza z podpowiedziami

Nsight Compute przedstawia zrozumiałe zalecenia. Wskazuje największe wąskie gardło, więc nie musisz od razu zgadywać.

Współczynniki trafień w pamięci podręcznej

Liczniki pamięci podręcznych L1 i L2 pokazują, jak często odczyty trafiają do pamięci podręcznej. Wyższe współczynniki trafień oznaczają mniej odwołań do wolnej pamięci globalnej.

Porównywanie dwóch wersji

Możesz wykonać porównanie różnic dwóch raportów wyświetlonych obok siebie. Dzięki temu od razu widać, czy ostatnia zmiana rzeczywiście poprawiła metryki.

Odtwarzanie sprawia, że działanie jest wolne

Ponieważ narzędzie odtwarza kernele, narzut profilowania jest duży. Używaj go do badania jednego kernela naraz, a nie podczas zwykłego uruchomienia.

Szybkie sprawdzenie

Raport kernela pokazuje głównie zatrzymania warpów związane z pamięcią.

Podsumowanie

Nsight Compute ujawnia metryki pojedynczego kernela: przepustowość, zatrzymania, wykorzystanie zasobów i wykres roofline. Użyj go, aby dokładnie potwierdzić, co należy zoptymalizować. 👏

Często zadawane pytania

Czy lekcja „Metryki kerneli w Nsight Compute” jest bezpłatna?

Tak — pełny tekst „Metryki kerneli w Nsight Compute” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu CUDA Academy, przejdź na CoddyKit PRO. Kurs CUDA Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Metryki kerneli w Nsight Compute”?

Analizować przepustowość, przestoje i dane roofline. Ćwiczysz CUDA Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć CUDA Academy?

Nie wymagamy żadnego doświadczenia. CUDA Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.

Ile czasu zajmuje lekcja „Metryki kerneli w Nsight Compute”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji CUDA Academy?

Tak. Każda lekcja CUDA Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Widok osi czasu w Nsight Systems
  2. Metryki kerneli w Nsight Compute
  3. Ograniczenie obliczeniami a ograniczenie pamięcią
  4. Adnotowanie kodu za pomocą NVTX
← Powrót do CUDA Academy