0Pricing
CUDA Academy · บทเรียน

อธิบาย cudaDeviceSynchronize

ทำไม CPU ต้องรอ GPU

อธิบาย cudaDeviceSynchronize เป็นบทเรียน CUDA Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน CUDA Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

CPU ไม่รอ

หลังการเรียกใช้งาน CPU จะทำงานต่ออย่างรวดเร็วขณะที่ GPU ยังประมวลผลอยู่ หากต้องการหยุดรอ ให้เรียก cudaDeviceSynchronize ⏳

myKernel<<<g, b>>>(p);
cudaDeviceSynchronize();

ความหมายของการซิงโครไนซ์

cudaDeviceSynchronize จะบล็อกโฮสต์จนกว่างาน GPU ที่อยู่ในคิวทั้งหมดจะเสร็จสิ้น จากนั้นบรรทัดถัดไปของ CPU จึงจะทำงาน

เหตุใดจึงจำเป็น

หากไม่ซิงโครไนซ์ คุณอาจอ่านผลลัพธ์ก่อนที่ GPU จะเขียนเสร็จ การซิงโครไนซ์รับประกันว่าเคอร์เนลทำงานเสร็จแล้วจริง ๆ

ส่งผลลัพธ์ printf ออกจากบัฟเฟอร์

นอกจากนี้ยังส่ง printf ของอุปกรณ์ออกจากบัฟเฟอร์ด้วย หากเคอร์เนลแสดงผลแต่ไม่มีอะไรปรากฏ สาเหตุมักเป็นการขาดการซิงโครไนซ์

hi<<<1, 4>>>();
cudaDeviceSynchronize(); // now you see it

คืนรหัสข้อผิดพลาด

การเรียกนี้คืนค่าเป็น cudaError_t ความล้มเหลวที่นี่มักเผยให้เห็นข้อขัดข้องที่เกิดขึ้นภายในเคอร์เนล

cudaError_t e = cudaDeviceSynchronize();

ตรวจจับข้อขัดข้องของเคอร์เนลที่ซ่อนอยู่

เคอร์เนลมักล้มเหลวโดยไม่แสดงข้อความ ดังนั้นการตรวจสอบรหัสข้อผิดพลาดจากการซิงโครไนซ์จึงเป็นวิธีค้นหาการเข้าถึงนอกขอบเขตหรือการเรียกใช้งานที่ไม่ถูกต้อง

if (e != cudaSuccess) printf("kernel failed\n");

cudaMemcpy ซิงโครไนซ์ด้วย

cudaMemcpy แบบปกติที่คัดลอกกลับไปยังโฮสต์จะรอ GPU ด้วย ในกรณีทั่วไปเช่นนี้ คุณอาจไม่จำเป็นต้องซิงโครไนซ์แยกต่างหาก

cudaMemcpy(host, dev, n, cudaMemcpyDeviceToHost);

อย่าซิงโครไนซ์มากเกินไป

การเรียกซิงโครไนซ์หลังทุกขั้นตอนจะทำลายการทำงานซ้อนทับและทำให้ช้าลง ซิงโครไนซ์เฉพาะเมื่อจำเป็นต้องอ่านผลลัพธ์หรือวัดเวลาอย่างแท้จริง

ซิงโครไนซ์เพื่อจับเวลา

หากต้องการจับเวลาเคอร์เนลอย่างถูกต้อง ให้ซิงโครไนซ์ทั้งก่อนและหลัง มิฉะนั้นตัวจับเวลาจะวัดเพียงความเร็วที่ CPU นำงานเข้าคิว

cudaDeviceSynchronize();
// start timer ... kernel ... sync ... stop

การซิงโครไนซ์สตรีมมีขอบเขตแคบกว่า

หากต้องการควบคุมให้ละเอียดขึ้น cudaStreamSynchronizeจะรอเฉพาะสตรีมเดียวแทนที่จะรอทั้งอุปกรณ์ เหมาะอย่างยิ่งเมื่องานทำงานซ้อนทับกัน

cudaStreamSynchronize(stream);

นิสัยเริ่มต้นที่ปลอดภัย

ระหว่างเรียนรู้ ให้ซิงโครไนซ์หลังการเรียกใช้งานแต่ละครั้งและตรวจสอบผลลัพธ์ เมื่อโค้ดทำงานได้มั่นคงแล้ว จึงลบการซิงโครไนซ์ส่วนเกินออกเพื่อเพิ่มความเร็ว

ตรวจสอบอย่างรวดเร็ว

ตรวจสอบความเข้าใจของคุณเกี่ยวกับการซิงโครไนซ์

สรุป: การซิงโครไนซ์

cudaDeviceSynchronize ทำให้ CPU รอ GPU ส่ง printf ออกจากบัฟเฟอร์ และแสดงข้อขัดข้องที่ซ่อนอยู่ ใช้อย่างเหมาะสม ไม่ใช่ใช้ทุกที่ 🎉

คำถามที่พบบ่อย

บทเรียน “อธิบาย cudaDeviceSynchronize” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “อธิบาย cudaDeviceSynchronize” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส CUDA Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “อธิบาย cudaDeviceSynchronize”

ทำไม CPU ต้องรอ GPU คุณปฏิบัติ CUDA Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน CUDA Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน CUDA Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน

บทเรียน “อธิบาย cudaDeviceSynchronize” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน CUDA Academy นี้ได้ไหม

ได้ บทเรียน CUDA Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. โครงสร้างของเคอร์เนล
  2. การเรียกใช้ด้วยวงเล็บมุมสามชั้น
  3. printf ภายในเคอร์เนล
  4. อธิบาย cudaDeviceSynchronize
← กลับไปที่ CUDA Academy