0Pricing
CUDA Academy · บทเรียน

Reduce, Scan และ Sort ของ Thrust

โครงสร้างพื้นฐานระดับสูงด้วยการเรียกเพียงครั้งเดียว

Reduce, Scan และ Sort ของ Thrust เป็นบทเรียน CUDA Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน CUDA Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

อัลกอริทึมซับซ้อนในบรรทัดเดียว

การเขียนการลดค่า การสแกน และการเรียงลำดับให้รวดเร็วด้วยตนเองนั้นทำได้ยาก Thrust มีเวอร์ชันที่ปรับแต่งมาแล้วให้ใช้ผ่านการเรียกฟังก์ชันเพียงครั้งเดียว 🎁

Reduce ยุบข้อมูลเหลือค่าเดียว

thrust::reduce รวมสมาชิกทุกตัวให้เป็นผลลัพธ์เดียว เช่น การหาผลรวมของอาร์เรย์ โดยทำงานแบบขนานทั้งหมดภายใต้เบื้องหลัง

int total = thrust::reduce(d.begin(), d.end());

ตัวดำเนินการลดค่าแบบกำหนดเอง

Reduce จะใช้การบวกเป็นค่าเริ่มต้น แต่คุณสามารถส่ง ค่าเริ่มต้นและการดำเนินการแบบไบนารี เพื่อคำนวณผลคูณ ค่าสูงสุด หรือการดำเนินการแบบเชื่อมโยงได้ทุกชนิด

int m = thrust::reduce(d.begin(), d.end(),
  0, thrust::maximum<int>());

Scan เก็บผลรวมสะสม

การสแกน หรือผลรวมพรีฟิกซ์ จะแสดงผลรวมสะสมในแต่ละตำแหน่ง ซึ่งเป็นแกนหลักของการบีบอัด การเรียงลำดับ และการจองหน่วยความจำสำหรับสตรีม

แบบรวมกับแบบไม่รวม

inclusive_scan จะรวมสมาชิกปัจจุบันไว้ในผลรวม ส่วน exclusive_scan จะไม่รวม การเลือกแบบที่ถูกต้องช่วยหลีกเลี่ยงข้อผิดพลาดแบบนับคลาดหนึ่งตำแหน่ง

thrust::inclusive_scan(d.begin(), d.end(),
  out.begin());

Scan ไม่ได้ทำให้ขนานได้อย่างชัดเจน

ผลรวมพรีฟิกซ์ดูเหมือนเป็นงานลำดับเดียว แต่ Thrust สามารถทำงานนี้แบบ ขนาน ด้วยอัลกอริทึมแบบต้นไม้ที่ชาญฉลาด ซึ่งคุณไม่ต้องเขียนเอง

เรียงลำดับในที่เดิม

thrust::sort เรียงลำดับ device_vector ในที่เดิมโดยใช้การเรียงแบบเรดิกซ์หรือแบบผสานบน GPU ซึ่งเร็วกว่าการเรียงลำดับบน CPU มากเมื่อมีข้อมูลขนาดใหญ่

thrust::sort(d.begin(), d.end());

เรียงตามคีย์

sort_by_key เรียงอาร์เรย์หนึ่งและจัดเรียงอาร์เรย์ค่าชุดที่สองใหม่ให้สอดคล้องกัน เหมาะสำหรับรักษาให้ระเบียนต่าง ๆ อยู่คู่กับคีย์ของตน

thrust::sort_by_key(keys.begin(),
  keys.end(), values.begin());

ประกอบองค์ประกอบพื้นฐาน

กระบวนการจริงมักเชื่อมการทำงานเหล่านี้เข้าด้วยกัน เช่น transform แล้วจึง reduce หรือ sort แล้วจึง scan แต่ละขั้นเป็นการเรียกใช้ที่ปรับแต่งมาแล้วหนึ่งครั้ง คุณจึงมุ่งเน้นที่ตรรกะได้

transform_reduce แบบรวมขั้นตอน

transform_reduce แปลงและหาผลรวมในรอบเดียว โดยคำนวณสิ่งต่าง ๆ เช่น ผลคูณเชิงจุดหรือผลรวมกำลังสองได้โดยไม่ต้องใช้อาร์เรย์ชั่วคราว

float ss = thrust::transform_reduce(
  d.begin(), d.end(), sq, 0.0f, thrust::plus<float>());

ปล่อยให้ไลบรารีจัดการ

องค์ประกอบพื้นฐานเหล่านี้ได้รับการ ปรับแต่งประสิทธิภาพอย่างมาก โดย NVIDIA การเลือกใช้สิ่งเหล่านี้ก่อนมักให้ผลดีกว่าเคอร์เนลที่เขียนเอง และช่วยประหยัดเวลาทำงานได้หลายชั่วโมง

ตรวจสอบความเข้าใจอย่างรวดเร็ว

ทบทวนว่าผลรวมพรีฟิกซ์ให้ผลลัพธ์อะไร

สรุปทบทวน

คุณยุบข้อมูลด้วย reduce สร้างผลรวมสะสมด้วย scan เรียงอาร์เรย์ด้วย sort และรวมขั้นตอนด้วย transform_reduce 🏁

คำถามที่พบบ่อย

บทเรียน “Reduce, Scan และ Sort ของ Thrust” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “Reduce, Scan และ Sort ของ Thrust” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส CUDA Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “Reduce, Scan และ Sort ของ Thrust”

โครงสร้างพื้นฐานระดับสูงด้วยการเรียกเพียงครั้งเดียว คุณปฏิบัติ CUDA Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน CUDA Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน CUDA Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน

บทเรียน “Reduce, Scan และ Sort ของ Thrust” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน CUDA Academy นี้ได้ไหม

ได้ บทเรียน CUDA Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. ใช้ GEMM ของ cuBLAS ให้ถูกต้อง
  2. เวกเตอร์และการแปลงของ Thrust
  3. Reduce, Scan และ Sort ของ Thrust
  4. cuDNN สำหรับการเรียนรู้เชิงลึก
← กลับไปที่ CUDA Academy