0Pricing
CUDA Academy · Pelajaran

Pertukaran dalam Memori Global

Besar, lambat, dan terlihat oleh setiap thread.

Pertukaran dalam Memori Global adalah pelajaran CUDA Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar CUDA Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus CUDA Academy mencakup 4 pelajaran total.

Ruang Terbesar yang Anda Miliki

Memori global adalah DRAM utama GPU, yang sering kali berukuran beberapa gigabita. Di sinilah larik input dan output besar Anda biasanya berada selama kernel berjalan.

Terlihat oleh Semua

Setiap thread di setiap blok dapat membaca dan menulis memori global. Keterlihatan bersama inilah alasan Anda menyalin data ke sana sebelum menjalankan kernel. 🌍

Anda Mengalokasikannya dengan cudaMalloc

Anda memesan memori global dari host dengan cudaMalloc, yang memberikan pointer perangkat ke wilayah DRAM tersebut.

float *d_a;
cudaMalloc(&d_a, n * sizeof(float));

Besar tetapi Lambat

Kekurangannya adalah latensi. Satu pembacaan memori global dapat memerlukan ratusan siklus clock, jauh lebih banyak daripada akses register.

Lebar Pita Merupakan Batas Sebenarnya

Banyak kernel dibatasi bukan oleh perhitungan matematika, melainkan oleh kecepatan byte mengalir dari DRAM. Kernel seperti ini disebut kernel terikat memori.

Menyembunyikan Latensi dengan Thread

GPU menyembunyikan pembacaan yang lambat dengan beralih ke warp lain yang siap saat salah satunya menunggu. Penyembunyian latensi inilah alasan banyak thread sangat penting.

Tetap Ada di Antara Peluncuran

Data dalam memori global tetap berada di tempatnya di antara peluncuran kernel sampai Anda membebaskannya. Anda dapat menjalankan beberapa kernel pada buffer yang sama.

Di-cache oleh L2

Cache L2 terpadu berada di depan memori global untuk seluruh GPU. Alamat yang digunakan kembali dapat dilayani dari cache tersebut, bukan dari DRAM yang lambat.

Pola Akses Menentukan Kecepatan

Cara thread dipetakan ke alamat sangat memengaruhi throughput. Thread yang bersebelahan menyentuh alamat yang bersebelahan—itulah yang disebut penggabungan akses dalam pelajaran berikutnya.

Minimalkan Perjalanan

Strategi utamanya sederhana: sentuh memori global sesedikit mungkin. Baca sekali, gunakan kembali di dalam cip, lalu tulis sekali.

Bebaskan yang Anda Alokasikan

Karena memori global merupakan sumber daya terbatas, bebaskan dengan cudaFree setelah selesai agar memori perangkat tidak bocor.

cudaFree(d_a);

Pemeriksaan Cepat

Pernyataan mana yang paling tepat menggambarkan pertukaran dalam penggunaan memori global?

Rangkuman: Besar, Bersama, Lambat

Sekarang Anda mengetahui bahwa memori global adalah DRAM GPU yang besar dan terlihat oleh semua pihak, dengan kapasitas besar sebagai imbalan atas latensi tinggi. Sentuh sesedikit mungkin dan gunakan kembali data di dalam cip. 🚀

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Pertukaran dalam Memori Global” gratis?

Ya — teks lengkap “Pertukaran dalam Memori Global” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus CUDA Academy, upgrade ke CoddyKit PRO. Kursus CUDA Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Pertukaran dalam Memori Global”?

Besar, lambat, dan terlihat oleh setiap thread. Kamu berlatih CUDA Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai CUDA Academy?

Tidak diperlukan pengalaman sebelumnya. CUDA Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.

Berapa lama pelajaran “Pertukaran dalam Memori Global” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran CUDA Academy ini?

Ya. Setiap pelajaran CUDA Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Register dan Memori Lokal
  2. Pertukaran dalam Memori Global
  3. Memori Konstan dan Cache-nya
  4. Model Mental Hierarki
← Kembali ke CUDA Academy