CUDA Academy · Pelajaran

Presisi Campuran: FP16, BF16, TF32

Menukar presisi dengan laju pemrosesan

Pelajaran 2 dari 413 langkah

Presisi Campuran: FP16, BF16, TF32 adalah pelajaran CUDA Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar CUDA Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus CUDA Academy mencakup 4 pelajaran total.

Menukar Bit dengan Kecepatan

Tensor Core memperoleh kecepatannya dari presisi campuran: menggunakan format angka yang lebih kecil agar perangkat keras dapat melakukan jauh lebih banyak perhitungan di setiap siklus. ⚡

Biaya FP32

FP32 standar menggunakan 32 bit per nilai. Format ini akurat tetapi berat, sehingga memindahkan dan mengalikan banyak angka FP32 menghabiskan bandwidth dan waktu.

Kenali FP16

FP16 hanya menggunakan 16 bit: eksponen yang lebih kecil dan bit mantisa yang lebih sedikit. Ukuran setengahnya berarti lebih banyak nilai dapat dipindahkan dan dikalikan sekaligus.

FP16 Memiliki Rentang Kecil

FP16 menghemat ruang, tetapi eksponennya yang sempit memberikan rentang dinamis yang sangat kecil. Nilai yang sangat besar atau sangat kecil dapat meluap atau menghilang menjadi nol.

Kenali BF16

BF16 juga menggunakan 16 bit, tetapi mempertahankan seluruh eksponen FP32 dan menukarnya dengan bit mantisa. BF16 memiliki rentang seperti FP32 dengan presisi yang lebih rendah.

Mengapa BF16 Unggul untuk Pelatihan

Karena BF16 memiliki rentang lebar seperti FP32, gradien jarang meluap. Hal ini menjadikan BF16 pilihan favorit untuk melatih jaringan saraf besar dengan aman.

Kenali TF32

TF32 adalah format Tensor Core 19 bit: menggunakan eksponen FP32 dengan mantisa yang dipangkas. Format ini mempercepat perhitungan sambil tampak seperti FP32 bagi kode Anda.

Akumulator Tetap Lebar

Terlepas dari format masukan, Tensor Core biasanya mengakumulasikan jumlah parsial dalam FP32. Kecepatannya berasal dari masukan; keamanannya berasal dari total berjalan.

Rentang vs Presisi

Gagasan utamanya: FP16 dan BF16 sama-sama menggunakan 16 bit, tetapi membaginya dengan cara berbeda. Yang satu mengutamakan presisi, sedangkan yang lain mengutamakan rentang.

Memilih Format

Gunakan BF16 atau TF32 ketika rentang penting, dan FP16 ketika Anda dapat mengatur penskalaan. Format yang tepat bergantung pada data Anda, bukan hanya pada kecepatan.

Mendeklarasikan Presisi Setengah

Dalam CUDA C++, tipe FP16 memiliki nama singkat. Baris ini mendeklarasikan satu nilai setengah yang siap digunakan untuk perhitungan Tensor Core.

__half x = __float2half(1.5f);

Pemeriksaan Singkat

Format mana yang mempertahankan seluruh rentang eksponen FP32 hanya dalam 16 bit?

Ringkasan

Anda telah melihat bagaimana presisi campuran menukar bit dengan laju pemrosesan: FP16 mengutamakan presisi, BF16 mengutamakan rentang, dan TF32 mempercepat perhitungan bergaya FP32. Akumulasi lebar menjaga hasil tetap aman. ✨

Gratis untuk memulai

Belajar C++ dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
30
Pelajaran
120

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Presisi Campuran: FP16, BF16, TF32” gratis?

Ya — teks lengkap “Presisi Campuran: FP16, BF16, TF32” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus CUDA Academy, upgrade ke CoddyKit PRO. Kursus CUDA Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Presisi Campuran: FP16, BF16, TF32”?

Menukar presisi dengan laju pemrosesan Kamu berlatih CUDA Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai CUDA Academy?

Tidak diperlukan pengalaman sebelumnya. CUDA Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.

Berapa lama pelajaran “Presisi Campuran: FP16, BF16, TF32” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran CUDA Academy ini?

Ya. Setiap pelajaran CUDA Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Apa yang Dihitung Tensor Core
  2. Presisi Campuran: FP16, BF16, TF32
  3. API Fragmen WMMA
  4. Pertukaran Stabilitas Numerik
← Kembali ke CUDA Academy