CUDA Academy · Pelajaran

Mengapa Memori Boleh Halaman Perlahan

Gunakan penimbal sementara di sebalik malloc biasa.

Pelajaran 1 daripada 413 langkah

Mengapa Memori Boleh Halaman Perlahan ialah pelajaran CUDA Academy percuma di CoddyKit. Ini ialah pelajaran 1 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran CUDA Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus CUDA Academy merangkumi sejumlah 4 pelajaran.

Tempat Data Anda Berada

Penimbal C++ biasa daripada malloc berada dalam memori hos boleh halaman. Ia kelihatan percuma, tetapi GPU tidak boleh menyalin daripadanya secara langsung, dan butiran kecil itu mengurangkan kelajuan Anda.

Maksud Boleh Halaman

Memori adalah boleh halaman apabila sistem pengendalian boleh mengalihkan halamannya atau menukarnya ke cakera pada bila-bila masa. Ia fleksibel, tetapi menyukarkan perkakasan yang memerlukan alamat tetap.

GPU Menggunakan DMA

GPU menarik data menggunakan DMA, iaitu pemindahan perkakasan langsung yang memerlukan alamat fizikal yang tidak akan berubah. Halaman boleh halaman memungkiri syarat itu, jadi halaman tersebut tidak boleh digunakan secara langsung.

Langkah Pementasan Tersembunyi

Untuk mengatasinya, pemacu menyalin penimbal boleh halaman Anda ke dalam penimbal pementasan tersembunyi terlebih dahulu, kemudian menghantarnya ke GPU. Anda membayar penyalinan tambahan yang tidak pernah Anda tulis. 😮

Dua Salinan, Bukan Satu

Jadi, satu cudaMemcpy daripada memori boleh halaman sebenarnya ialah dua salinan: hos ke pementasan, kemudian pementasan ke peranti. Kerja berganda itulah sebab pemindahan boleh halaman terasa lembap.

malloc Biasa

Inilah penimbal yang biasanya digunakan terlebih dahulu. Ia berfungsi, tetapi setiap pemindahan daripada h_data secara senyap melalui laluan pementasan itu.

float* h_data = (float*)malloc(N * sizeof(float));
cudaMemcpy(d_data, h_data, bytes, cudaMemcpyHostToDevice);

Mengapa Sistem Pengendalian Mengambil Berat

Sistem pengendalian mengekalkan memori supaya boleh halaman agar ia dapat memperuntukkan RAM secara berlebihan dan melayani banyak program serentak. Kemudahan itulah yang menghalang GPU daripada membaca halaman Anda secara langsung.

Jalur Lebar yang Hilang

Pemindahan boleh halaman sering hanya mencapai separuh daripada jalur lebar maksimum pautan Anda. Penyalinan pementasan menggunakan kitaran CPU dan trafik memori yang sepatutnya boleh digunakan oleh pemindahan sebenar.

Ia Juga Menghalang Pertindihan

Oleh sebab penyalinan pementasan adalah segerak, pemindahan boleh halaman tidak boleh benar-benar bertindih dengan kernel. Anda kehilangan teknik asinkron yang menjadikan aliran berbaloi.

Apabila Ia Masih Menyakitkan

Untuk satu penyalinan kecil, tiada siapa yang menyedarinya. Tetapi dalam gelung yang menghantar data pada setiap lelaran, cukai pementasan itu terkumpul dan secara senyap mendominasi masa pelaksanaan Anda.

Penyelesaiannya Akan Tiba

Penyelesaiannya ialah meminta CUDA menyediakan penimbal yang tidak boleh dipindahkan ke storan sekunder, yang dipanggil memori dipasak. GPU membacanya secara terus, tanpa penyalinan perantaraan atau salinan berganda.

Semakan Pantas

Mengapakah pemindahan daripada memori biasa yang boleh dipindahkan ke storan sekunder lebih perlahan daripada sepatutnya?

Imbas Kembali

Penimbal yang boleh dipindahkan membolehkan lokasinya berubah, jadi GPU tidak boleh menggunakan DMA terhadapnya secara terus. Pemacu menyalinnya ke penimbal perantaraan dahulu, lalu menggandakan salinan. Penyelesaian yang akan datang ialah memori dipasak. 🚀

Percuma untuk bermula

Pelajari C++ dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
30
Pelajaran
120

Soalan Lazim

Adakah pelajaran “Mengapa Memori Boleh Halaman Perlahan” percuma?

Ya — teks penuh “Mengapa Memori Boleh Halaman Perlahan” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus CUDA Academy, tingkat taraf kepada CoddyKit PRO. Kursus CUDA Academy merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Mengapa Memori Boleh Halaman Perlahan”?

Gunakan penimbal sementara di sebalik malloc biasa. Anda berlatih CUDA Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan CUDA Academy?

Tiada pengalaman terdahulu diperlukan. Pembelajaran CUDA Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 1 daripada 4.

Berapa lamakah pelajaran “Mengapa Memori Boleh Halaman Perlahan” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran CUDA Academy ini?

Ya. Setiap pelajaran CUDA Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Mengapa Memori Boleh Halaman Perlahan
  2. Memori Dipasak dengan cudaMallocHost
  3. cudaMemcpyAsync dalam Strim
  4. Saluran Paip Penimbal Berganda
← Kembali ke CUDA Academy