API Fragmen WMMA
Memuatkan, mma_sync dan menyimpan fragmen
API Fragmen WMMA ialah pelajaran CUDA Academy percuma di CoddyKit. Ini ialah pelajaran 3 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran CUDA Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus CUDA Academy merangkumi sejumlah 4 pelajaran.
API WMMA
Untuk memprogram Tensor Core secara langsung, anda menggunakan WMMA, iaitu API pendaraban-tambah matriks warp dalam ruang nama nvcuda::wmma. 🧩
Satu Warp Bekerjasama
WMMA meliputi seluruh warp: kesemua 32 utas dalam satu warp bekerjasama pada satu jubin. Anda berfikir dalam jubin, bukan utas tunggal.
Kenali Fragmen
Fragmen ialah jenis data WMMA yang menyimpan bahagian jubin matriks milik satu warp. Setiap utas secara senyap memiliki beberapa unsurnya.
Tiga Peranan Fragmen
Anda mengisytiharkan fragmen yang ditandai sebagai matrix_a, matrix_b atau accumulator. Tanda itu memberitahu WMMA cara jubin tersebut digunakan dalam pendaraban-tambah.
Bentuk Jubin Adalah Tetap
Fragmen menggunakan saiz jubin yang ditetapkan seperti 16 kali 16 kali 16. Anda memilih bentuk yang disokong; perkakasan hanya menerima gabungan tersebut.
Langkah 1: Muatkan
Mula-mula anda memanggil load_matrix_sync untuk menarik jubin daripada ingatan ke dalam fragmen. Pemuatan ini mengagihkan data merentasi warp untuk anda.
wmma::load_matrix_sync(a_frag, ptr, ldm);Langkah 2: Kosongkan Pengumpuk
Sebelum menambah, anda menetapkan jubin hasil kepada sifar dengan fill_fragment. Pengumpuk yang bersih bermakna jumlah anda bermula daripada nilai yang diketahui.
wmma::fill_fragment(c_frag, 0.0f);Langkah 3: Pendaraban-Tambah
Panggilan teras ialah mma_sync. Ia menjalankan D = A darab B tambah C pada fragmen yang dimuatkan menggunakan Tensor Core secara langsung.
wmma::mma_sync(c_frag, a_frag, b_frag, c_frag);Langkah 4: Simpan
Akhir sekali, store_matrix_sync menulis fragmen pengumpuk kembali ke ingatan. Penyimpanan ini mengumpulkan bahagian setiap utas menjadi satu jubin.
wmma::store_matrix_sync(out, c_frag, ldm, layout);Segerak Bermaksud Segerak-Warp
Akhiran _sync mengingatkan anda: setiap panggilan WMMA adalah segerak-warp. Kesemua 32 lorong mesti mencapainya bersama-sama atau tingkah laku tidak ditakrifkan.
Susun Atur dan Dimensi Utama
Pemuatan dan penyimpanan memerlukan dimensi utama, iaitu langkah antara baris, serta susun atur utama-baris atau utama-lajur untuk membaca ingatan dengan betul.
Semakan Pantas
Panggilan WMMA yang manakah sebenarnya menjalankan pendaraban-tambah matriks pada Tensor Core?
Ringkasan
Anda telah mengikuti aliran WMMA: isytiharkan fragmen, muatkan jubin, kosongkan pengumpuk, panggil mma_sync, kemudian simpan. Setiap langkah adalah segerak-warp. 🙌
Pelajari C++ dengan tutor kecerdasan buatan — percuma
Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.
- Kursus
- 30
- Pelajaran
- 120
Soalan Lazim
Adakah pelajaran “API Fragmen WMMA” percuma?
Ya — teks penuh “API Fragmen WMMA” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus CUDA Academy, tingkat taraf kepada CoddyKit PRO. Kursus CUDA Academy merangkumi sejumlah 4 pelajaran.
Apakah yang akan saya pelajari dalam “API Fragmen WMMA”?
Memuatkan, mma_sync dan menyimpan fragmen Anda berlatih CUDA Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.
Adakah saya memerlukan pengalaman untuk memulakan CUDA Academy?
Tiada pengalaman terdahulu diperlukan. Pembelajaran CUDA Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 3 daripada 4.
Berapa lamakah pelajaran “API Fragmen WMMA” diambil?
Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.
Bolehkah saya menulis dan menjalankan kod dalam pelajaran CUDA Academy ini?
Ya. Setiap pelajaran CUDA Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.
Semua pelajaran dalam kursus ini
- Pengiraan Teras Tensor
- Ketepatan Campuran: FP16, BF16, TF32
- API Fragmen WMMA
- Pertukaran Kestabilan Berangka