CUDA Academy · Pelajaran

API Fragmen WMMA

Memuatkan, mma_sync dan menyimpan fragmen

Pelajaran 3 daripada 413 langkah

API Fragmen WMMA ialah pelajaran CUDA Academy percuma di CoddyKit. Ini ialah pelajaran 3 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran CUDA Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus CUDA Academy merangkumi sejumlah 4 pelajaran.

API WMMA

Untuk memprogram Tensor Core secara langsung, anda menggunakan WMMA, iaitu API pendaraban-tambah matriks warp dalam ruang nama nvcuda::wmma. 🧩

Satu Warp Bekerjasama

WMMA meliputi seluruh warp: kesemua 32 utas dalam satu warp bekerjasama pada satu jubin. Anda berfikir dalam jubin, bukan utas tunggal.

Kenali Fragmen

Fragmen ialah jenis data WMMA yang menyimpan bahagian jubin matriks milik satu warp. Setiap utas secara senyap memiliki beberapa unsurnya.

Tiga Peranan Fragmen

Anda mengisytiharkan fragmen yang ditandai sebagai matrix_a, matrix_b atau accumulator. Tanda itu memberitahu WMMA cara jubin tersebut digunakan dalam pendaraban-tambah.

Bentuk Jubin Adalah Tetap

Fragmen menggunakan saiz jubin yang ditetapkan seperti 16 kali 16 kali 16. Anda memilih bentuk yang disokong; perkakasan hanya menerima gabungan tersebut.

Langkah 1: Muatkan

Mula-mula anda memanggil load_matrix_sync untuk menarik jubin daripada ingatan ke dalam fragmen. Pemuatan ini mengagihkan data merentasi warp untuk anda.

wmma::load_matrix_sync(a_frag, ptr, ldm);

Langkah 2: Kosongkan Pengumpuk

Sebelum menambah, anda menetapkan jubin hasil kepada sifar dengan fill_fragment. Pengumpuk yang bersih bermakna jumlah anda bermula daripada nilai yang diketahui.

wmma::fill_fragment(c_frag, 0.0f);

Langkah 3: Pendaraban-Tambah

Panggilan teras ialah mma_sync. Ia menjalankan D = A darab B tambah C pada fragmen yang dimuatkan menggunakan Tensor Core secara langsung.

wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);

Langkah 4: Simpan

Akhir sekali, store_matrix_sync menulis fragmen pengumpuk kembali ke ingatan. Penyimpanan ini mengumpulkan bahagian setiap utas menjadi satu jubin.

wmma::store_matrix_sync(out, c_frag, ldm, layout);

Segerak Bermaksud Segerak-Warp

Akhiran _sync mengingatkan anda: setiap panggilan WMMA adalah segerak-warp. Kesemua 32 lorong mesti mencapainya bersama-sama atau tingkah laku tidak ditakrifkan.

Susun Atur dan Dimensi Utama

Pemuatan dan penyimpanan memerlukan dimensi utama, iaitu langkah antara baris, serta susun atur utama-baris atau utama-lajur untuk membaca ingatan dengan betul.

Semakan Pantas

Panggilan WMMA yang manakah sebenarnya menjalankan pendaraban-tambah matriks pada Tensor Core?

Ringkasan

Anda telah mengikuti aliran WMMA: isytiharkan fragmen, muatkan jubin, kosongkan pengumpuk, panggil mma_sync, kemudian simpan. Setiap langkah adalah segerak-warp. 🙌

Percuma untuk bermula

Pelajari C++ dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
30
Pelajaran
120

Soalan Lazim

Adakah pelajaran “API Fragmen WMMA” percuma?

Ya — teks penuh “API Fragmen WMMA” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus CUDA Academy, tingkat taraf kepada CoddyKit PRO. Kursus CUDA Academy merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “API Fragmen WMMA”?

Memuatkan, mma_sync dan menyimpan fragmen Anda berlatih CUDA Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan CUDA Academy?

Tiada pengalaman terdahulu diperlukan. Pembelajaran CUDA Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 3 daripada 4.

Berapa lamakah pelajaran “API Fragmen WMMA” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran CUDA Academy ini?

Ya. Setiap pelajaran CUDA Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Pengiraan Teras Tensor
  2. Ketepatan Campuran: FP16, BF16, TF32
  3. API Fragmen WMMA
  4. Pertukaran Kestabilan Berangka
← Kembali ke CUDA Academy