0Pricing
CUDA Academy · Lekcja

Mieszana precyzja: FP16, BF16, TF32

Wymiana precyzji na przepustowość

Mieszana precyzja: FP16, BF16, TF32 to bezpłatna lekcja CUDA Academy na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej CUDA Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs CUDA Academy zawiera 4 lekcji w sumie.

Wymiana bitów na szybkość

Tensor Cores zawdzięczają swoją szybkość mieszanej precyzji: przyjmują mniejsze formaty liczb, dzięki czemu sprzęt może wykonywać znacznie więcej obliczeń w każdym cyklu. ⚡

Ile kosztuje FP32

Standardowy format FP32 używa 32 bitów na wartość. Jest dokładny, ale ciężki, więc przesyłanie i mnożenie wielu liczb FP32 zużywa dużo przepustowości i czasu.

Poznaj FP16

FP16 używa zaledwie 16 bitów: ma mniejszy wykładnik i mniej bitów mantysy. Połowa rozmiaru oznacza, że jednocześnie można przesyłać i mnożyć więcej wartości.

FP16 ma mały zakres

FP16 oszczędza miejsce, ale jego wąski wykładnik zapewnia niewielki zakres dynamiczny. Bardzo duże lub bardzo małe wartości mogą przepełnić zakres albo zniknąć, przyjmując wartość zero.

Poznaj BF16

BF16 również używa 16 bitów, ale zachowuje pełny wykładnik FP32, rezygnując zamiast tego z części bitów mantysy. Ma zakres FP32 przy mniejszej precyzji.

Dlaczego BF16 wygrywa w trenowaniu

Ponieważ BF16 ma tak szeroki zakres jak FP32, gradienty rzadko ulegają przepełnieniu. Dzięki temu BF16 jest chętnie używany do bezpiecznego trenowania dużych sieci neuronowych.

Poznaj TF32

TF32 to 19-bitowy format Tensor Core: ma wykładnik FP32, ale skróconą mantysę. Przyspiesza obliczenia, a dla kodu zachowuje się jak FP32.

Akumulator pozostaje szeroki

Niezależnie od formatu danych wejściowych Tensor Cores zwykle akumulują sumy częściowe w FP32. Szybkość zapewniają dane wejściowe, a bezpieczeństwo — bieżąca suma.

Zakres a precyzja

Najważniejsza idea jest następująca: FP16 i BF16 kosztują tyle samo, czyli 16 bitów, ale dzielą je inaczej. Jeden format stawia na precyzję, a drugi na zakres.

Wybór formatu

Należy używać BF16 lub TF32, gdy ważny jest zakres, a FP16, gdy można kontrolować skalowanie. Właściwy format zależy od danych, a nie tylko od szybkości.

Deklarowanie połowy precyzji

W CUDA C++ typ FP16 ma krótką nazwę. Ta linia deklaruje jedną wartość typu half, gotową do obliczeń na Tensor Cores.

__half x = __float2half(1.5f);

Szybkie sprawdzenie

Który format zachowuje pełny zakres wykładnika FP32, używając tylko 16 bitów?

Podsumowanie

Zobaczył Pan, jak mieszana precyzja wymienia bity na przepustowość: FP16 stawia na precyzję, BF16 na zakres, a TF32 przyspiesza obliczenia w stylu FP32. Szeroka akumulacja zapewnia bezpieczeństwo wyników. ✨

Często zadawane pytania

Czy lekcja „Mieszana precyzja: FP16, BF16, TF32” jest bezpłatna?

Tak — pełny tekst „Mieszana precyzja: FP16, BF16, TF32” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu CUDA Academy, przejdź na CoddyKit PRO. Kurs CUDA Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Mieszana precyzja: FP16, BF16, TF32”?

Wymiana precyzji na przepustowość Ćwiczysz CUDA Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć CUDA Academy?

Nie wymagamy żadnego doświadczenia. CUDA Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.

Ile czasu zajmuje lekcja „Mieszana precyzja: FP16, BF16, TF32”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji CUDA Academy?

Tak. Każda lekcja CUDA Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Co obliczają Tensor Cores
  2. Mieszana precyzja: FP16, BF16, TF32
  3. API fragmentów WMMA
  4. Kompromisy stabilności numerycznej
← Powrót do CUDA Academy