CUDA Academy · บทเรียน

สตรีมไทล์สำหรับภาพขนาดใหญ่

ทำงานนำเข้าและส่งออกซ้อนทับกับการคำนวณ

บทเรียน 3 จาก 413 ขั้นตอน

สตรีมไทล์สำหรับภาพขนาดใหญ่ เป็นบทเรียน CUDA Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน CUDA Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

เมื่อภาพมีขนาดใหญ่เกินไป

ภาพขนาดใหญ่มากอาจไม่พอดีกับหน่วยความจำของ GPU หรือการคัดลอกทั้งภาพอาจทำให้ไปป์ไลน์หยุดชะงัก วิธีแก้คือแบ่งภาพเป็นไทล์แล้วประมวลผลทีละส่วน 🖼️

แบ่งออกเป็นส่วนย่อย

แบ่งภาพเป็นแถบแถวหรือไทล์รูปสี่เหลี่ยม แต่ละไทล์มีขนาดเล็กพอที่จะอัปโหลด ประมวลผล และดาวน์โหลดได้โดยไม่ทำให้หน่วยความจำของอุปกรณ์ทำงานหนักเกินไป

สามขั้นตอนต่อหนึ่งไทล์

ไทล์ทุกชิ้นจะทำตามลำดับเดียวกัน: คัดลอกไปยังอุปกรณ์ เรียกใช้เคอร์เนล แล้วคัดลอกผลลัพธ์กลับมา ทำซ้ำจนประมวลผลภาพทั้งหมดเสร็จ

ไทล์แบบอนุกรมทำให้เสียเวลา

หากทำทีละชิ้น GPU จะว่างระหว่างการคัดลอกทุกครั้ง เพื่อให้ได้ประโยชน์ คุณต้องซ้อนทับการถ่ายโอนไทล์หนึ่งกับการคำนวณของอีกไทล์หนึ่ง

สตรีมช่วยให้ซ้อนทับงานได้

ส่งงานของไทล์แต่ละชิ้นไปยังสตรีมของตนเอง จากนั้นไดรเวอร์จะสามารถเรียกใช้เคอร์เนลของไทล์หนึ่งขณะที่การคัดลอกของอีกไทล์ยังดำเนินอยู่

cudaStream_t s;
cudaStreamCreate(&s);

จำเป็นต้องคัดลอกแบบอะซิงโครนัส

cudaMemcpy แบบปกติจะบล็อกโฮสต์และทำให้การซ้อนทับงานใช้ไม่ได้ ให้ใช้ cudaMemcpyAsync บนสตรีม เพื่อจัดคิวการคัดลอกโดยไม่หยุดทุกอย่าง

cudaMemcpyAsync(d_tile, h_tile, bytes, cudaMemcpyHostToDevice, s);

ตรึงบัฟเฟอร์ของโฮสต์

การถ่ายโอนแบบอะซิงโครนัสต้องใช้หน่วยความจำโฮสต์แบบตรึงเพื่อใช้ DMA จัดสรรบัฟเฟอร์พักข้อมูลของไทล์ด้วย cudaMallocHost มิฉะนั้นการซ้อนทับจะเปลี่ยนไปใช้การบล็อกอย่างเงียบ ๆ

cudaMallocHost(&h_tile, bytes);

ใช้บัฟเฟอร์คู่ในไปป์ไลน์

เตรียมบัฟเฟอร์ไทล์สองชุดและสลับสตรีม ขณะที่ไทล์ N กำลังคำนวณ ไทล์ N+1 จะกำลังอัปโหลด ทำให้การถ่ายโอนถูกซ่อนไว้เบื้องหลังงานในไปป์ไลน์ที่ต่อเนื่องราบรื่น

พิกเซลขอบเผื่อที่ขอบไทล์

การเบลอใกล้ขอบไทล์ต้องใช้พิกเซลจากไทล์ข้างเคียง ให้เพิ่มขอบเผื่อที่ซ้อนทับกัน เพื่อให้ผลลัพธ์บริเวณขอบยังถูกต้อง

ซิงโครไนซ์ก่อนบันทึก

งานแบบอะซิงโครนัสยังไม่เสร็จเมื่อการเรียกใช้ส่งคืนค่า ให้เรียก cudaStreamSynchronize บนแต่ละสตรีมก่อนอ่านผลลัพธ์ของไทล์กลับมายังโฮสต์

cudaStreamSynchronize(s);

ภาพใหญ่ GPU ทำงานต่อเนื่อง

เมื่อใช้ไทล์แบบสตรีมและบัฟเฟอร์คู่ GPU จะได้รับงานป้อนอย่างต่อเนื่องไม่ว่าภาพจะมีขนาดเท่าใด การถ่ายโอนจะถูกซ่อนไว้เบื้องหลังการคำนวณ และอัตราการประมวลผลยังคงสูง ⚡

ตรวจสอบอย่างรวดเร็ว

คุณส่งไทล์ไปยังสตรีมแยกกัน แต่ไม่เห็นการซ้อนทับงาน ข้อผิดพลาดใดมีแนวโน้มมากที่สุด

สรุปทบทวน

คุณได้แบ่งภาพใหญ่เป็นไทล์ ใช้สตรีมร่วมกับการคัดลอกแบบอะซิงโครนัสและหน่วยความจำแบบตรึงเพื่อซ้อนทับงาน ใช้บัฟเฟอร์คู่ในไปป์ไลน์ และเพิ่มขอบเผื่อเพื่อให้ขอบภาพถูกต้อง 🎯

เริ่มต้นได้ฟรี

เรียนรู้ C++ ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
30
บทเรียน
120

คำถามที่พบบ่อย

บทเรียน “สตรีมไทล์สำหรับภาพขนาดใหญ่” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “สตรีมไทล์สำหรับภาพขนาดใหญ่” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส CUDA Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “สตรีมไทล์สำหรับภาพขนาดใหญ่”

ทำงานนำเข้าและส่งออกซ้อนทับกับการคำนวณ คุณปฏิบัติ CUDA Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน CUDA Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน CUDA Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน

บทเรียน “สตรีมไทล์สำหรับภาพขนาดใหญ่” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน CUDA Academy นี้ได้ไหม

ได้ บทเรียน CUDA Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. ออกแบบไปป์ไลน์การประมวลผล
  2. รวมตัวกรองเป็นเคอร์เนลเดียว
  3. สตรีมไทล์สำหรับภาพขนาดใหญ่
  4. วิเคราะห์ ปรับให้เหมาะสม ส่งมอบ
← กลับไปที่ CUDA Academy