CUDA Academy · บทเรียน

คอขวดการถ่ายโอน PCIe

ทำไมการคัดลอกจึงมักเป็นส่วนที่ช้า

บทเรียน 4 จาก 413 ขั้นตอน

คอขวดการถ่ายโอน PCIe เป็นบทเรียน CUDA Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน CUDA Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

สะพานเชื่อมระหว่างสองโลก

CPU และ GPU อยู่บนแผงวงจรแยกกันและเชื่อมต่อด้วยบัส PCIe cudaMemcpy ทุกครั้งต้องส่งผ่านสะพานแคบ ๆ นี้ 🌉

ความเร็วไม่เท่ากัน

แบนด์วิดท์ของหน่วยความจำ GPU อาจสูงถึงหลายเทราไบต์ต่อวินาที แต่ PCIe รองรับเพียงหลักสิบกิกะไบต์ บัสนี้จึงเป็นจุดเชื่อมต่อที่ช้าที่สุด

การคัดลอกอาจใช้เวลาส่วนใหญ่

สำหรับเคอร์เนลที่ทำงานรวดเร็ว เวลา ถ่ายโอนข้อมูลอาจมากกว่าเวลาคำนวณอย่างมาก ทำให้ GPU ต้องหยุดรอข้อมูล

คัดลอกให้น้อย คำนวณให้มาก

วิธีแก้ขั้นแรกนั้นง่ายมาก: ย้ายเฉพาะข้อมูลที่จำเป็น และทำ งานให้มากขึ้น ต่อไบต์เมื่อข้อมูลอยู่บน GPU แล้ว

เก็บข้อมูลไว้บนอุปกรณ์

หลีกเลี่ยงการส่งอาร์เรย์ไปมาซ้ำ ๆ ให้เก็บอาร์เรย์เหล่านั้นไว้บนอุปกรณ์ตลอดการทำงานของเคอร์เนลหลายตัว แทนการอัปโหลดใหม่ทุกครั้ง

รวมการคัดลอกขนาดเล็กเป็นชุด

การถ่ายโอนขนาดเล็กจำนวนมากจะเสียค่าใช้จ่ายพื้นฐานทุกครั้ง การ รวมเป็นชุด แล้วคัดลอกครั้งเดียวขนาดใหญ่มีประสิทธิภาพกว่ามาก 📦

ทำงานซ้อนกันด้วยสตรีม

คุณสามารถซ่อนต้นทุนการถ่ายโอนได้โดยทำให้การคัดลอกซ้อนทับกับการคำนวณผ่าน สตรีม เพื่อให้ GPU ทำงานไปพร้อมกับที่ข้อมูลกำลังไหล

หน่วยความจำตรึงช่วยได้

หน่วยความจำโฮสต์แบบ ตรึง ช่วยให้ DMA และการคัดลอกแบบอะซิงโครนัสทำได้เร็วขึ้น นี่คือกุญแจสำคัญในการทำให้การถ่ายโอนซ้อนทับกับเคอร์เนลได้อย่างแท้จริง

วัดผล อย่าเดา

จับเวลาแยกกันระหว่างการคัดลอกและเคอร์เนล เครื่องมือ วิเคราะห์ประสิทธิภาพ เช่น Nsight จะแสดงจุดที่บัสสร้างปัญหาให้คุณอย่างชัดเจน

แนวคิด Roofline

หากโปรแกรมของคุณถูกจำกัดด้วย การถ่ายโอนข้อมูล เคอร์เนลที่เร็วขึ้นก็ไม่ช่วยอะไร ให้ลดการเคลื่อนย้ายข้อมูลก่อน แล้วจึงปรับปรุงการคำนวณ

คุ้มกับการเดินทางหรือไม่

สำหรับปัญหาขนาดเล็ก ต้นทุนการคัดลอกอาจมากกว่าความเร็วที่เพิ่มขึ้น GPU จะคุ้มค่าเมื่อ การคำนวณ ใช้เวลามากกว่าการถ่ายโอนอย่างชัดเจน

ตรวจสอบความเข้าใจ

การวิเคราะห์ประสิทธิภาพแสดงว่าโปรแกรมใช้เวลาส่วนใหญ่เคลื่อนย้ายข้อมูลผ่าน PCIe วิธีใดช่วยได้มากที่สุด

สรุปทบทวน

คุณได้เห็นแล้วว่าเหตุใด PCIe จึงเป็นจุดเชื่อมต่อที่ช้า: คัดลอกให้น้อย เก็บข้อมูลไว้บนอุปกรณ์ รวมการถ่ายโอนเป็นชุด ทำงานซ้อนกันด้วยสตรีม และวัดผลอยู่เสมอ 🎉

เริ่มต้นได้ฟรี

เรียนรู้ C++ ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
30
บทเรียน
120

คำถามที่พบบ่อย

บทเรียน “คอขวดการถ่ายโอน PCIe” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “คอขวดการถ่ายโอน PCIe” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส CUDA Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “คอขวดการถ่ายโอน PCIe”

ทำไมการคัดลอกจึงมักเป็นส่วนที่ช้า คุณปฏิบัติ CUDA Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน CUDA Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน CUDA Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน

บทเรียน “คอขวดการถ่ายโอน PCIe” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน CUDA Academy นี้ได้ไหม

ได้ บทเรียน CUDA Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. ถ่ายโอนข้อมูลจากโฮสต์ไปอุปกรณ์
  2. ถ่ายโอนข้อมูลจากอุปกรณ์ไปโฮสต์
  3. ชนิดแจกแจงทิศทางการคัดลอก
  4. คอขวดการถ่ายโอน PCIe
← กลับไปที่ CUDA Academy