CUDA Academy · บทเรียน

วงจรชีวิตของโปรแกรม CUDA

จองหน่วยความจำ คัดลอก เรียกใช้ คัดลอกกลับ และคืนหน่วยความจำ

บทเรียน 4 จาก 413 ขั้นตอน

วงจรชีวิตของโปรแกรม CUDA เป็นบทเรียน CUDA Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน CUDA Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

จังหวะที่เกิดซ้ำ

CUDA เกือบทุกโปรแกรมใช้ลำดับการทำงาน 5 ขั้นตอนเหมือนกัน เรียนรู้จังหวะนี้ให้ดี แล้วคุณจะอ่านโค้ด GPU ใด ๆ ได้ 🕺

ขั้นตอนที่ 1: จัดสรรหน่วยความจำ

ขั้นแรก จองหน่วยความจำของอุปกรณ์สำหรับข้อมูลนำเข้าและผลลัพธ์ด้วย cudaMalloc เนื่องจาก GPU ไม่สามารถใช้บัฟเฟอร์ของโฮสต์ได้โดยตรง

cudaMalloc(&d_a, bytes);
cudaMalloc(&d_b, bytes);

ขั้นตอนที่ 2: คัดลอกเข้า

จากนั้นอัปโหลดข้อมูลนำเข้าจากโฮสต์ไปยังอุปกรณ์ด้วย cudaMemcpy ตอนนี้ GPU จะมีสำเนาข้อมูลของตัวเองสำหรับประมวลผล

cudaMemcpy(d_a, h_a, bytes, cudaMemcpyHostToDevice);

ขั้นตอนที่ 3: เรียกใช้งาน

จากนั้นเรียกใช้เคอร์เนลกับเธรดจำนวนมาก ขั้นตอนนี้คือจุดที่การประมวลผลแบบขนานเกิดขึ้นจริงบนอุปกรณ์ 🚀

myKernel<<<blocks, threads>>>(d_a, d_b, n);

ขั้นตอนที่ 4: คัดลอกกลับ

เมื่อการคำนวณเสร็จสิ้น ให้ดาวน์โหลดผลลัพธ์จากอุปกรณ์กลับมายังโฮสต์ เพื่อให้ CPU อ่านและนำไปใช้งานได้

cudaMemcpy(h_b, d_b, bytes, cudaMemcpyDeviceToHost);

ขั้นตอนที่ 5: คืนหน่วยความจำ

สุดท้ายคืนหน่วยความจำของอุปกรณ์ทุกบัฟเฟอร์ด้วย cudaFree หากข้ามขั้นตอนนี้ จะทำให้หน่วยความจำ GPU รั่วไหลและไม่สามารถนำไปใช้กับงานอื่นได้

cudaFree(d_a);
cudaFree(d_b);

อย่าลืมซิงโครไนซ์

เนื่องจากการเรียกใช้งานทำงานแบบอะซิงโครนัส ให้เรียก cudaDeviceSynchronize ก่อนอ่านผลลัพธ์ เพื่อให้แน่ใจว่า GPU ทำงานเสร็จสมบูรณ์แล้ว

cudaDeviceSynchronize();

การคัดลอกใช้เวลา

ขั้นตอนการคัดลอกต้องผ่านบัส PCIe ที่ช้า ดังนั้นการถ่ายโอนข้อมูลจึงมักเป็นคอขวดที่แท้จริง ไม่ใช่ตัวเคอร์เนลเอง

นำบัฟเฟอร์กลับมาใช้ใหม่

การจัดสรรหน่วยความจำครั้งเดียวแล้วนำบัฟเฟอร์กลับมาใช้ใหม่ในการเรียกใช้งานหลายครั้ง ย่อมดีกว่าการจัดสรรหน่วยความจำใหม่ทุกครั้งที่วนรอบ

ความสมมาตรของรูปแบบ

สังเกตความสมมาตร: cudaMalloc ทุกครั้งจะจับคู่กับ cudaFree และการคัดลอกเข้าทุกครั้งจะจับคู่กับการคัดลอกออกในท้ายที่สุด

วงจรชีวิตในประโยคเดียว

ท่องเหมือนคาถา: จัดสรรหน่วยความจำ คัดลอก เรียกใช้งาน คัดลอกกลับ คืนหน่วยความจำ บรรทัดเดียวนี้คือโครงร่างของโปรแกรมเคอร์เนลเกือบทุกโปรแกรม

ตรวจสอบอย่างรวดเร็ว

มาทบทวนวงจรชีวิตมาตรฐานของโปรแกรม CUDA กัน

สรุป

คุณได้เรียนรู้วงจรชีวิต CUDA 5 ขั้นตอน: จัดสรรหน่วยความจำ คัดลอกเข้า เรียกใช้งาน คัดลอกกลับ คืนหน่วยความจำ รวมถึงการซิงโครไนซ์ก่อนอ่านผลลัพธ์ 🎉

เริ่มต้นได้ฟรี

เรียนรู้ C++ ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
30
บทเรียน
120

คำถามที่พบบ่อย

บทเรียน “วงจรชีวิตของโปรแกรม CUDA” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “วงจรชีวิตของโปรแกรม CUDA” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส CUDA Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “วงจรชีวิตของโปรแกรม CUDA”

จองหน่วยความจำ คัดลอก เรียกใช้ คัดลอกกลับ และคืนหน่วยความจำ คุณปฏิบัติ CUDA Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน CUDA Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน CUDA Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน

บทเรียน “วงจรชีวิตของโปรแกรม CUDA” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน CUDA Academy นี้ได้ไหม

ได้ บทเรียน CUDA Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. ตัวระบุคุณสมบัติฟังก์ชัน __global__
  2. ฟังก์ชัน __device__ และ __host__
  3. พื้นที่แอดเดรสแยกจากกัน
  4. วงจรชีวิตของโปรแกรม CUDA
← กลับไปที่ CUDA Academy