CUDA Academy · บทเรียน

ทำการคัดลอกและคำนวณซ้อนกัน

ซ่อนเวลาถ่ายโอนไว้เบื้องหลังเคอร์เนล

บทเรียน 4 จาก 413 ขั้นตอน

ทำการคัดลอกและคำนวณซ้อนกัน เป็นบทเรียน CUDA Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน CUDA Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

แนวคิดสำคัญ

การเพิ่มความเร็วที่แท้จริงเกิดจากการทำสองสิ่งพร้อมกัน: คัดลอกข้อมูลส่วนหนึ่งขณะที่ GPU กำลังคำนวณข้อมูลอีกส่วนหนึ่ง 🔀

หน่วยฮาร์ดแวร์แยกกัน

GPU มี หน่วยคัดลอก และหน่วยคำนวณแยกจากกัน การทำงานซ้อนกันเกิดขึ้นได้เพราะหน่วยเหล่านี้ทำงานขนานกันจริง ไม่ใช่เพียงผลัดกันทำงาน

ต้องใช้หน่วยความจำที่ตรึงไว้

การคัดลอกแบบอะซิงโครนัสต้องใช้หน่วยความจำโฮสต์แบบ ตรึงไว้จาก cudaMallocHost ส่วน malloc แบบแบ่งหน้าได้ทั่วไปจะบังคับให้คัดลอกแบบบล็อก ซึ่งทำงานซ้อนกันไม่ได้

cudaMallocHost(&h_data, bytes);

การคัดลอกแบบอะซิงโครนัส

ใช้ cudaMemcpyAsync พร้อมสตรีม เพื่อให้การถ่ายโอนคืนค่าทันทีและเข้าร่วมคิวของสตรีมนั้นควบคู่ไปกับเคอร์เนล

cudaMemcpyAsync(d_in, h_in, bytes, cudaMemcpyHostToDevice, s);

แบ่งงานเป็นส่วน ๆ

แบ่งอาร์เรย์ออกเป็นส่วนย่อยและให้แต่ละส่วนมี สตรีมของตนเอง ขณะที่สตรีม 0 กำลังคำนวณ สตรีม 1 ก็สามารถเริ่มคัดลอกได้แล้ว

คัดลอก คำนวณ คัดลอกกลับ

แต่ละส่วนทำสามขั้นตอนเดิมในสตรีมของตนเอง: อัปโหลดข้อมูลเข้า เรียกใช้ เคอร์เนล ดาวน์โหลดผลลัพธ์กลับ ทั้งหมดนี้โดยไม่บล็อกโฮสต์

cudaMemcpyAsync(d, h, n, H2D, s);
k<<<g, b, 0, s>>>(d);
cudaMemcpyAsync(h, d, n, D2H, s);

การทำงานซ้อนกันเกิดขึ้นได้อย่างไร

เนื่องจากแต่ละส่วนอยู่ในสตรีมที่แตกต่างกัน GPU จึงสามารถ คัดลอกส่วนที่สองขณะที่ยังคำนวณส่วนแรกอยู่ได้ ไทม์ไลน์จึงถูกเติมเต็ม 📊

ซ่อนต้นทุนของ PCIe

การถ่ายโอนไม่ได้เพิ่มเวลาทั้งหมดอีกต่อไป แต่ถูกซ่อน อยู่เบื้องหลังการคำนวณ ในกรณีที่เหมาะสม เวลาทำงานจะลดลงจนใกล้เคียงกับเวลาที่นานกว่าระหว่างการคัดลอกกับเคอร์เนล

ระวังสตรีมเริ่มต้น

การเรียกใช้สตรีมเริ่มต้นหลุดเข้ามาเพียงครั้งเดียวระหว่างลูป ก็อาจทำให้ทุกอย่างกลับมา ทำงานเป็นลำดับเดียวอีกครั้ง ผูกการดำเนินการแบบอะซิงโครนัสทุกอย่างไว้กับสตรีมจริงที่ไม่ใช่สตรีมเริ่มต้น

ตรวจสอบด้วยเครื่องมือวิเคราะห์ประสิทธิภาพ

เปิด Nsight Systems แล้วมองหาเลนการคัดลอกและการคำนวณที่ ทำงานซ้อนกันตามเวลา เลนที่ซ้อนกันและมีงานอยู่แสดงว่าการทำงานพร้อมกันเกิดขึ้นจริง

ซิงโครไนซ์เมื่อสิ้นสุด

หลังจากส่งส่วนงานทั้งหมดแล้ว ให้เรียกใช้ cudaDeviceSynchronize หนึ่งครั้ง เพื่อให้ทุกสตรีมทำงานเสร็จก่อนที่คุณจะอ่านผลลัพธ์สุดท้ายบนโฮสต์

cudaDeviceSynchronize();

ตรวจสอบความเข้าใจอย่างรวดเร็ว

การถ่ายโอนแบบอะซิงโครนัสต้องมีอะไรจึงจะทำงานซ้อนกับการคำนวณได้

ทบทวน

ด้วยการแบ่งงานข้ามสตรีมโดยใช้หน่วยความจำแบบ ตรึงไว้และการคัดลอกแบบอะซิงโครนัส คุณจะซ่อนการถ่ายโอนไว้เบื้องหลังการคำนวณและทำให้ GPU ทำงานอย่างเต็มที่ได้จริง 🚀

เริ่มต้นได้ฟรี

เรียนรู้ C++ ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
30
บทเรียน
120

คำถามที่พบบ่อย

บทเรียน “ทำการคัดลอกและคำนวณซ้อนกัน” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “ทำการคัดลอกและคำนวณซ้อนกัน” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส CUDA Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “ทำการคัดลอกและคำนวณซ้อนกัน”

ซ่อนเวลาถ่ายโอนไว้เบื้องหลังเคอร์เนล คุณปฏิบัติ CUDA Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน CUDA Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน CUDA Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน

บทเรียน “ทำการคัดลอกและคำนวณซ้อนกัน” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน CUDA Academy นี้ได้ไหม

ได้ บทเรียน CUDA Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. กับดักของสตรีมเริ่มต้น
  2. สร้างและใช้สตรีม
  3. อีเวนต์สำหรับจับเวลาและซิงค์
  4. ทำการคัดลอกและคำนวณซ้อนกัน
← กลับไปที่ CUDA Academy