การแบ่งพาร์ติชัน GPU หลายอินสแตนซ์
Multi-Instance GPU (MIG) เป็นเทคโนโลยี NVIDIA ที่แบ่ง GPU จริงตัวเดียวออกเป็นหลายพาร์ติชั่นฮาร์ดแวร์ที่แยกออกจากกัน
ภาพรวม
It matters because it lets one expensive accelerator serve many small workloads at once without them interfering with each other.
เจาะลึก
เปิดตัวด้วย NVIDIA A100 (Ampere) และใช้งานต่อบน H100 และ GPU ศูนย์ข้อมูลรุ่นใหม่ MIG แยก GPU ออกเป็นอินสแตนซ์อิสระสูงสุดเจ็ดอินสแตนซ์ แตกต่างจากซอฟต์แวร์การแบ่งเวลา MIG ให้การแยกฮาร์ดแวร์อย่างแท้จริง: แต่ละอินสแตนซ์จะได้รับมัลติโปรเซสเซอร์สตรีมมิ่ง (SM), ชิ้นแคช L2, ตัวควบคุมหน่วยความจำ และชิ้นคงที่ของหน่วยความจำแบนด์วิธสูง A100 ที่มี 40GB สามารถแบ่งออกเป็นอินสแตนซ์ขนาด 5GB ได้เจ็ดอินสแตนซ์หรือใหญ่กว่านั้น แต่ละพาร์ติชั่นทำงานเหมือนกับ GPU แบบสแตนด์อโลนที่เล็กกว่า ดังนั้นงานที่ส่งเสียงดังหรือขัดข้องในอินสแตนซ์หนึ่งไม่สามารถอดอาหารหรือสร้างความเสียหายให้กับอีกอินสแตนซ์หนึ่งได้ คุณภาพของการบริการที่รับประกันนี้ทำให้ MIG เหมาะสำหรับการให้บริการการอนุมาน คลัสเตอร์ที่มีผู้เช่าหลายราย และสภาพแวดล้อมการพัฒนาที่ผู้ใช้จำนวนมากใช้การ์ดร่วมกัน
ข้อมูลเชิงลึกทางเทคนิค
MIG ทำงานโดยกั้นคานประตูภายในของ GPU เพื่อให้แต่ละอินสแตนซ์มีเส้นทางที่ตายตัวไปยังชิ้นส่วนหน่วยความจำและ SM ของตัวเอง NVIDIA กำหนดโปรไฟล์เป็นเศษส่วน เช่น 1g.5gb (หนึ่งชิ้นการประมวลผล 5GB) สูงสุด 7g.40gb อินสแตนซ์ GPU สงวนหน่วยความจำและ SM ภายในนั้น Compute Instance จะแบ่งย่อย SM ออกไปอีก เนื่องจากพาร์ติชันนั้นบังคับใช้ด้วยฮาร์ดแวร์ ข้อบกพร่อง ข้อผิดพลาด ECC และแบนด์วิดท์หน่วยความจำจึงถูกจำกัดอยู่ในอินสแตนซ์เดียว
ผลกระทบเชิงกลยุทธ์
ต้นทุนและงบประมาณ
การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี
การตัดสินใจที่ชัดเจนยิ่งขึ้น
การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด
การควบคุมคุณภาพ
ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต
อนาคตของการแบ่งพาร์ติชัน GPU หลายอินสแตนซ์
เมื่อ GPU ขยายเป็น 80GB, 141GB และมากกว่านั้น การแบ่งพาร์ติชั่นจะน่าสนใจยิ่งขึ้น เนื่องจากแต่ละรุ่นไม่จำเป็นต้องใช้การ์ดทั้งหมดในการอนุมาน คาดว่าจะมีการรวม Kubernetes และคลาวด์ที่เข้มงวดมากขึ้น การแบ่งพาร์ติชันแบบไดนามิกโดยไม่ทำให้โหนดเปลือง และโปรไฟล์ที่ละเอียดยิ่งขึ้น ผู้จำหน่ายที่แข่งขันกันกำลังแสวงหาการจำลองเสมือน GPU สไตล์ SR-IOV ที่คล้ายกัน และแพลตฟอร์มการอนุมานแบบไร้เซิร์ฟเวอร์พึ่งพาการแบ่งพาร์ติชันมากขึ้นเพื่อบรรจุโมเดลจำนวนมากไว้หนาแน่นและลดขยะที่ไม่ได้ใช้งาน
การใช้งานจริงในโลกแห่งความเป็นจริง
ผู้ให้บริการระบบคลาวด์แบ่ง A100 หนึ่งเครื่องออกเป็นเจ็ดอินสแตนซ์ ดังนั้นลูกค้าเจ็ดรายแต่ละรายจะได้รับชิ้นส่วน GPU ที่รับประกันและแยกส่วนสำหรับการอนุมาน
กลุ่มการวิจัยของมหาวิทยาลัยมอบอินสแตนซ์ MIG ขนาด 10GB แก่นักศึกษาปริญญาเอกแต่ละคนสำหรับการสร้างต้นแบบ แทนที่จะผูกขาดการ์ดทั้งหมด
บริการอนุมานได้รวมโมเดลภาษาและการมองเห็นขนาดเล็กจำนวนมากไว้ใน H100 ตัวเดียว โดยแต่ละโมเดลอยู่ในพาร์ติชันของตัวเองพร้อมเวลาแฝงที่คาดการณ์ได้
คลัสเตอร์ Kubernetes โฆษณาอินสแตนซ์ MIG ว่าเป็นทรัพยากรที่กำหนดเวลาได้ ดังนั้นพ็อดจึงขอ 'nvidia.com/mig-1g.5gb' เช่นเดียวกับทรัพยากรอื่นๆ
ความเสี่ยงและรั้ว
การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้
ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป
ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น
แผนงานการดำเนินงาน
กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน
เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง
การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้
เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Instance GPU Partitioning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การเรียนรู้แบบหลายงาน
คำถามที่พบบ่อย
What is Multi-Instance GPU Partitioning?
Multi-Instance GPU (MIG) เป็นเทคโนโลยี NVIDIA ที่แบ่ง GPU จริงตัวเดียวออกเป็นหลายพาร์ติชั่นฮาร์ดแวร์ที่แยกออกจากกัน สิ่งสำคัญคือช่วยให้ตัวเร่งความเร็วราคาแพงตัวหนึ่งสามารถรองรับเวิร์กโหลดเล็กๆ น้อยๆ จำนวนมากได้ในคราวเดียว โดยไม่รบกวนซึ่งกันและกัน
MIG มีการแยกประเภทใดระหว่างอินสแตนซ์
MIG บังคับใช้การแยกส่วนในฮาร์ดแวร์, การจัดสรร SM, ส่วนแคช L2 และหน่วยความจำให้กับแต่ละอินสแตนซ์ ดังนั้นปริมาณงานจึงไม่รบกวน
MIG เปิดตัวครั้งแรกบนสถาปัตยกรรม NVIDIA ใด
MIG เปิดตัวครั้งแรกด้วย A100 ที่ใช้ Ampere และต่อยอดบน H100 และ GPU สำหรับศูนย์ข้อมูลรุ่นใหม่กว่า
GPU ที่รองรับ MIG สามารถแบ่งออกเป็นอินสแตนซ์ได้สูงสุดจำนวนเท่าใด
GPU ที่รองรับ MIG เช่น A100 สามารถแบ่งพาร์ติชันออกเป็นอินสแตนซ์อิสระได้สูงสุดเจ็ดอินสแตนซ์
ในโปรไฟล์ MIG เช่น '1g.5gb' '5gb' แสดงถึงอะไร
โปรไฟล์เข้ารหัสส่วนการประมวลผล (1g) และหน่วยความจำเฉพาะ (5GB) ที่มอบให้กับอินสแตนซ์
MIG เหมาะสมกับปริมาณงานใดเป็นพิเศษ
MIG โดดเด่นเมื่อเวิร์กโหลดขนาดเล็กจำนวนมาก (เช่น การอนุมาน) แบ่งปันการ์ดใบเดียวพร้อมรับประกันคุณภาพการบริการ