CUDA Academy · บทเรียน

ประกาศอาร์เรย์ __shared__

หน่วยความจำชั่วคราวความเร็วสูงต่อบล็อก

บทเรียน 1 จาก 413 ขั้นตอน

ประกาศอาร์เรย์ __shared__ เป็นบทเรียน CUDA Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน CUDA Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

พื้นที่จดชั่วคราวสำหรับแต่ละบล็อก

แต่ละบล็อกจะได้รับหน่วยความจำบนชิปขนาดเล็กและรวดเร็วที่เรียกว่าหน่วยความจำที่ใช้ร่วมกัน ลองนึกภาพว่าเป็นพื้นที่จดชั่วคราวที่ทั้งบล็อกสามารถเขียนและอ่านร่วมกันได้

เหตุใดจึงรวดเร็วมาก

หน่วยความจำที่ใช้ร่วมกันอยู่บนหน่วยประมวลผลหลายตัวแบบสตรีมมิงโดยตรง จึงเร็วกว่าหน่วยความจำส่วนกลางประมาณ 100 เท่า ใช้เพื่อหลีกเลี่ยงการเข้าถึง DRAM นอกชิปที่ช้า 🚀

คีย์เวิร์ด __shared__

คุณประกาศใช้งานด้วยตัวระบุคุณสมบัติ __shared__ ภายในเคอร์เนล จากนั้นอาร์เรย์นี้จะถูกใช้ร่วมกันโดยทุกเธรดในบล็อก

__global__ void kern() {
    __shared__ float tile[256];
}

ขนาดคงที่ขณะคอมไพล์

เมื่อคุณระบุขนาดในวงเล็บ นั่นคือหน่วยความจำที่ใช้ร่วมกันแบบคงที่ คอมไพเลอร์ต้องรู้ขนาด ดังนั้นค่าดังกล่าวต้องเป็นค่าคงที่ ไม่ใช่ค่าที่ทราบตอนทำงาน

__shared__ int counts[128];

สำเนาเดียว ไม่ใช่สำเนาต่อเธรด

แนวคิดสำคัญคือ อาร์เรย์ __shared__ จะถูกสร้างครั้งเดียวต่อบล็อก ไม่ใช่ครั้งเดียวต่อเธรด เธรดทั้งหมดมองเห็นอาร์เรย์เดียวกันทุกประการ

เธรดร่วมมือกันผ่านหน่วยความจำนี้

เนื่องจากทุกเธรดมองเห็นข้อมูลเดียวกัน หน่วยความจำที่ใช้ร่วมกันจึงทำให้เธรดสามารถร่วมมือกันได้ เธรดหนึ่งเก็บค่าไว้ แล้วเธรดข้างเคียงนำค่านั้นไปใช้ได้

ขอบเขตระดับบล็อก ไม่เกินกว่านั้น

อายุการใช้งานของมันตรงกับอายุของบล็อก อาร์เรย์จะเกิดขึ้นเมื่อบล็อกเริ่มทำงานและหายไปเมื่อบล็อกสิ้นสุด ดังนั้นจึงมีขอบเขตระดับบล็อกเท่านั้น 🧱

แต่ละเธรดมีช่องของตนเอง

รูปแบบที่พบบ่อยคือกำหนดหนึ่งช่องต่อเธรด โดยใช้ threadIdx.x เป็นดัชนี แต่ละเธรดจะโหลดองค์ประกอบของตนเข้าสู่หน่วยความจำที่ใช้ร่วมกันพร้อมกัน

__shared__ float s[256];
s[threadIdx.x] = input[i];

ทรัพยากรเล็กแต่มีค่า

หน่วยความจำที่ใช้ร่วมกันมีขนาดเล็ก โดยมักมีเพียง48 ถึง 100 KB ต่อ SM หากขอใช้ต่อบล็อกมากเกินไป จำนวนบล็อกที่ทำงานพร้อมกันได้จะลดลง

การใช้งานแบบคลาสสิก: เตรียมไทล์

งานที่พบบ่อยที่สุดคือการเตรียมไทล์ของข้อมูลส่วนกลาง เพื่อให้บล็อกนำกลับมาใช้ซ้ำได้หลายครั้งโดยไม่ต้องกลับไปอ่าน DRAM ที่ช้า

บล็อกอื่นมองไม่เห็น

จำขอบเขตนี้ไว้: หน่วยความจำที่ใช้ร่วมกันเป็นพื้นที่ส่วนตัวของบล็อก บล็อกที่แตกต่างกันสองบล็อกจะได้รับสำเนาแยกจากกันของตนเอง และไม่สามารถดูข้อมูลของกันและกันได้

ตรวจสอบอย่างรวดเร็ว

มาตรวจสอบขอบเขตการใช้งานของหน่วยความจำที่ใช้ร่วมกันกัน

สรุปทบทวน

คุณได้เรียนรู้ว่า __shared__ มอบพื้นที่จดชั่วคราวบนชิปที่รวดเร็วให้แต่ละบล็อก โดยสร้างขึ้นครั้งเดียวต่อบล็อกและเหมาะสำหรับเตรียมข้อมูลที่นำกลับมาใช้ซ้ำ บทถัดไป: ทำให้เธรดทำงานสอดคล้องกัน 🎯

เริ่มต้นได้ฟรี

เรียนรู้ C++ ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
30
บทเรียน
120

คำถามที่พบบ่อย

บทเรียน “ประกาศอาร์เรย์ __shared__” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “ประกาศอาร์เรย์ __shared__” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส CUDA Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “ประกาศอาร์เรย์ __shared__”

หน่วยความจำชั่วคราวความเร็วสูงต่อบล็อก คุณปฏิบัติ CUDA Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน CUDA Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน CUDA Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน

บทเรียน “ประกาศอาร์เรย์ __shared__” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน CUDA Academy นี้ได้ไหม

ได้ บทเรียน CUDA Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. ประกาศอาร์เรย์ __shared__
  2. ซิงโครไนซ์ด้วย __syncthreads
  3. หลีกเลี่ยงความขัดแย้งของแบงก์
  4. หน่วยความจำร่วมแบบไดนามิก
← กลับไปที่ CUDA Academy