0Pricing
MLOps Academy · บทเรียน

รันโมเดลหลายอินสแตนซ์ต่อ GPU

ใช้การทำงานพร้อมกันเพื่อเพิ่มอัตราการใช้งาน

รันโมเดลหลายอินสแตนซ์ต่อ GPU เป็นบทเรียน MLOps Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน MLOps Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส MLOps Academy มีบทเรียนทั้งหมด 4 บทเรียน

สำเนาเดียวอาจทำให้ระบบชะงัก

เมื่อมีสำเนาโมเดลเพียงชุดเดียว คำขอที่สองต้องรอขณะที่คำขอแรกกำลังทำงาน แม้ GPU จะทำงานเร็ว ก็อาจ ว่างระหว่างการเรียกใช้ ทำให้อัตราการประมวลผลที่ควรได้สูญเปล่า

เรียกใช้หลายสำเนา

Triton สามารถโหลด อินสแตนซ์หลายชุดของโมเดลเดียวกัน เพื่อให้ประมวลผลคำขอหลายรายการพร้อมกันและทำงานเหลื่อมกันบน GPU ได้

บล็อก instance_group

คุณประกาศสำเนาได้ด้วย instance_group ใน config.pbtxt โดยฟิลด์ count จะระบุจำนวนอินสแตนซ์ที่ Triton ควรสร้างสำหรับโมเดลนั้น

instance_group {
  count: 2
  kind: KIND_GPU
}

เลือก GPU หรือ CPU

ฟิลด์ kind ใช้เลือกอุปกรณ์ KIND_GPU จะเรียกใช้อินสแตนซ์บน GPU ส่วน KIND_CPU จะเรียกใช้บนหน่วยประมวลผลของโฮสต์แทน

วางอินสแตนซ์บน GPU

คุณสามารถกำหนดให้อินสแตนซ์อยู่บนการ์ดบางใบได้ด้วยรายการ gpus วิธีนี้ช่วยให้โมเดลหนึ่งกระจายสำเนาไปยัง GPU หลายตัวในเซิร์ฟเวอร์เดียวกัน

instance_group {
  count: 2
  kind: KIND_GPU
  gpus: [ 0, 1 ]
}

เหตุใดจึงช่วยได้

ขณะที่อินสแตนซ์หนึ่งกำลังคำนวณ อีกอินสแตนซ์หนึ่งสามารถโหลดอินพุตหรือคัดลอกผลลัพธ์ได้ การทำงาน เหลื่อมกันนี้ช่วยซ่อนช่วงว่างและเพิ่มการใช้ทรัพยากรโดยรวม

ใช้ร่วมกับการรวมกลุ่ม

อินสแตนซ์และการรวมกลุ่มแบบไดนามิกทำงานร่วมกันได้ การรวมกลุ่มช่วยเติมข้อมูลให้แต่ละการเรียกใช้ ขณะที่หลายอินสแตนซ์ทำให้มีการเรียกใช้มากกว่าหนึ่งรายการอยู่ระหว่างประมวลผลพร้อมกัน

ระวังการใช้หน่วยความจำ

แต่ละอินสแตนซ์จะเก็บสำเนาน้ำหนักของตัวเองไว้ในหน่วยความจำ GPU หากมีสำเนามากเกินไป คุณจะ ใช้ VRAM จนหมด ดังนั้นควรค่อย ๆ เพิ่มจำนวน

มากขึ้นไม่ได้เร็วขึ้นเสมอไป

เมื่อเกินจุดหนึ่ง อินสแตนซ์เพิ่มเติมจะเพียง แย่งชิงทรัพยากรการคำนวณเดียวกัน อัตราการประมวลผลจะคงที่หรือลดลง ดังนั้นจำนวนที่ดีที่สุดต้องมาจากการวัด ไม่ใช่การคาดเดา

คำนึงถึงการทำงานพร้อมกัน

จำนวนอินสแตนซ์ที่เหมาะสมขึ้นอยู่กับจำนวนคำขอที่เข้ามาพร้อมกัน ให้จำนวนอินสแตนซ์สอดคล้องกับ การทำงานพร้อมกันจริง เพื่อหลีกเลี่ยงทั้งการชะงักและการใช้ทรัพยากรสูญเปล่า

จุดเริ่มต้นที่เหมาะสม

การใช้อินสแตนซ์สองชุดต่อ GPU เป็น จุดเริ่มต้นที่พบได้ทั่วไป ทดสอบด้วยโหลดที่ใกล้เคียงจริง แล้วปรับจำนวนขึ้นหรือลงตามสิ่งที่สังเกตได้

ตรวจสอบอย่างรวดเร็ว

การกำหนด count เป็น 2 ใน instance_group ทำอะไร

สรุป

คุณได้เรียนรู้การเรียกใช้สำเนาโมเดลหลายชุดผ่าน instance_group จับคู่อินสแตนซ์กับการรวมกลุ่มเพื่อการประมวลผลแบบขนาน พร้อมเฝ้าดู VRAM และปรับจำนวนจากการวัดผล 🙌

คำถามที่พบบ่อย

บทเรียน “รันโมเดลหลายอินสแตนซ์ต่อ GPU” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “รันโมเดลหลายอินสแตนซ์ต่อ GPU” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส MLOps Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส MLOps Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “รันโมเดลหลายอินสแตนซ์ต่อ GPU”

ใช้การทำงานพร้อมกันเพื่อเพิ่มอัตราการใช้งาน คุณปฏิบัติ MLOps Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน MLOps Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน MLOps Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน

บทเรียน “รันโมเดลหลายอินสแตนซ์ต่อ GPU” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน MLOps Academy นี้ได้ไหม

ได้ บทเรียน MLOps Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. เหตุใด GPU จึงต้องประมวลผลแบบกลุ่ม
  2. กำหนดการประมวลผลแบบกลุ่มไดนามิกใน Triton
  3. รันโมเดลหลายอินสแตนซ์ต่อ GPU
  4. วิเคราะห์และปรับแต่งเวลาแฝงของการอนุมาน
← กลับไปที่ MLOps Academy