0Pricing
CUDA Academy · Lekcja

Potok z podwójnym buforowaniem

Dzielić dane na porcje, aby GPU zawsze miało pracę.

Potok z podwójnym buforowaniem to bezpłatna lekcja CUDA Academy na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej CUDA Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs CUDA Academy zawiera 4 lekcji w sumie.

Problem bezczynnego GPU

Najpierw kopiujesz ogromną tablicę, potem uruchamiasz kernel, a na końcu kopiujesz dane z powrotem. Podczas każdego kopiowania GPU pozostaje bezczynne, a podczas obliczeń bezczynne są silniki transferu.

Podziel pracę

Rozwiązanie zaczyna się od podzielenia jednej ogromnej tablicy na mniejsze fragmenty. Każdy fragment można kopiować i przetwarzać niezależnie, otwierając drogę do nakładania operacji.

Dwa bufory, dwa tory

Podwójne buforowanie wykorzystuje dwa urządzeniowe bufory i dwa strumienie. Gdy strumień A oblicza jeden fragment, strumień B kopiuje kolejny.

Nakładaj kopiowanie i obliczenia

Cała magia tkwi we współbieżności: transfer i kernel działają jednocześnie na różnych fragmentach. Czas transferu jest ukryty za użytecznymi obliczeniami.

Wymagana pamięć przypięta

Działa to tylko wtedy, gdy dane hosta znajdują się w przypiętej pamięci. Bufory stronicowane wymuszają kopiowanie blokujące, przez co cały potok wraca do wykonywania szeregowego.

Pętla potoku

Iterujesz po fragmentach, a w każdym kroku zlecasz asynchroniczne kopiowanie do urządzenia, kernel i asynchroniczne kopiowanie z urządzenia — wszystko w tym samym strumieniu.

cudaMemcpyAsync(d_in, h_in + off, csz, H2D, s);
proc<<<g, b, 0, s>>>(d_in, d_out);
cudaMemcpyAsync(h_out + off, d_out, csz, D2H, s);

Naprzemiennie używaj strumieni

Przypisuj każdy fragment do strumienia, naprzemiennie zmieniając strumienie. Parzyste fragmenty trafiają do strumienia 0, a nieparzyste do strumienia 1, dzięki czemu sąsiednie fragmenty nakładają się bez problemów.

cudaStream_t s = streams[i % 2];

Dlaczego wystarczą dwa

Dwa strumienie już wystarczają, aby nakładać kopiowanie na obliczenia. Więcej buforów zwiększa głębokość potoku, ale przynosi coraz mniejsze korzyści i zwiększa zużycie pamięci, więc warto zacząć od dwóch.

Opróżnij potok na końcu

Po umieszczeniu wszystkich fragmentów w kolejce zaczekaj na zakończenie całej pracy, zanim odczytasz wyniki. Proste cudaDeviceSynchronize opróżnia wszystkie strumienie jednocześnie.

cudaDeviceSynchronize();

Przyspieszenie

Gdy kopiowanie jest ukryte za obliczeniami, całkowity czas zbliża się do kosztu tylko dłuższej z tych dwóch operacji, a nie do ich sumy. Na tym polega prawdziwa korzyść. 🚀

Kiedy zyski są największe

Podwójne buforowanie najlepiej sprawdza się, gdy czas transferu i czas obliczeń są mniej więcej zrównoważone. Jeśli jedna z tych wartości zdecydowanie dominuje, najpierw skup się na skróceniu właśnie jej.

Szybki test

Jaka jest główna korzyść potoku z podwójnym buforowaniem?

Podsumowanie

Podziel dane na fragmenty, użyj dwóch przypiętych buforów i strumieni, a następnie nakładaj kopiowanie na obliczenia. Zsynchronizuj pracę na końcu i obserwuj, jak czas transferu znika. 🎉

Często zadawane pytania

Czy lekcja „Potok z podwójnym buforowaniem” jest bezpłatna?

Tak — pełny tekst „Potok z podwójnym buforowaniem” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu CUDA Academy, przejdź na CoddyKit PRO. Kurs CUDA Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Potok z podwójnym buforowaniem”?

Dzielić dane na porcje, aby GPU zawsze miało pracę. Ćwiczysz CUDA Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć CUDA Academy?

Nie wymagamy żadnego doświadczenia. CUDA Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.

Ile czasu zajmuje lekcja „Potok z podwójnym buforowaniem”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji CUDA Academy?

Tak. Każda lekcja CUDA Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Dlaczego pamięć stronicowana jest wolna
  2. Pamięć przypięta za pomocą cudaMallocHost
  3. cudaMemcpyAsync w strumieniu
  4. Potok z podwójnym buforowaniem
← Powrót do CUDA Academy