技術指南

多執行個體GPU分區

多執行個體 GPU (MIG) 是一項 NVIDIA 技術,可將單一實體 GPU 分割為多個獨立的硬體分割區。

閱讀時間約2分鐘最後更新

概述

It matters because it lets one expensive accelerator serve many small workloads at once without them interfering with each other.

深入探討

MIG 隨 NVIDIA A100 (Ampere) 推出,並在 H100 和更新的資料中心 GPU 上繼續使用,將 GPU 劃分為最多七個獨立實例。與軟體時間切片不同,MIG 提供真正的硬體隔離:每個執行個體都有自己的專用串流多處理器 (SM)、L2 快取切片、記憶體控制器和固定的高頻寬記憶體切片。 40GB 的 A100 可以拆分為七個 5GB 實例,或更少的較大實例。每個分割區的行為就像一個較小的獨立 GPU,因此一個實例中的雜訊或崩潰的作業不會導致另一個實例挨餓或損壞。這種有保證的服務品質使 MIG 非常適合推理服務、多租戶叢集以及許多用戶共享一張卡的開發環境。

技術洞察

MIG 的工作原理是實體門控 GPU 的內部交叉開關,因此每個實例都有一條通往自己的記憶體片和 SM 的固定路徑。 NVIDIA 將設定檔定義為分數,例如 1g.5gb(一個計算切片,5GB)到 7g.40gb。 GPU實例保留記憶體和SM;其中計算實例進一步細分 SM。由於分區是硬體強制的,因此故障、ECC 錯誤和記憶體頻寬僅限於單一實例。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

多執行個體 GPU 分割區的未來

隨著 GPU 成長到 80GB、141GB 甚至更高,分割區變得更具吸引力,因為單一型號很少需要整張卡進行推理。期待更緊密的 Kubernetes 和雲端整合、無需耗盡節點的動態重新分區以及更細粒度的設定檔。競爭廠商正在追求類似的 SR-IOV 式 GPU 虛擬化,無伺服器推理平台越來越依賴分區來密集打包許多模型並減少閒置浪費。

現實世界的實施

一家雲端供應商將一個 A100 拆分為七個實例,以便七個客戶每個都獲得一個有保證的、獨立的 GPU 切片用於推理。

大學研究群集為每位博士生提供一個 10GB MIG 實例用於原型設計,而不是獨佔整張卡。

推理服務將多個小型語言和視覺模型打包到一個 H100 上,每個模型都位於自己的分區中,具有可預測的延遲。

Kubernetes 叢集將 MIG 執行個體宣傳為可調度資源,因此 Pod 會像任何其他資源一樣要求「nvidia.com/mig-1g.5gb」。

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Instance GPU Partitioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is Multi-Instance GPU Partitioning?

多執行個體 GPU (MIG) 是一項 NVIDIA 技術,可將單一實體 GPU 分割為多個獨立的硬體分割區。這很重要,因為它可以讓一個昂貴的加速器同時處理許多小型工作負載,而不會相互幹擾。

MIG 在實例之間提供什麼樣的隔離?

MIG 強制實施硬體隔離,將 SM、L2 快取片和記憶體專用於每個實例,以便工作負載不會幹擾。

MIG 首次在哪種 NVIDIA 架構上推出?

MIG 首次推出基於 Ampere 的 A100,並在 H100 和後來的資料中心 GPU 上繼續發展。

支援 MIG 的 GPU 最多可以拆分為多少個執行個體?

支援 MIG 的 GPU(例如 A100)可以劃分為最多七個獨立實例。

在「1g.5gb」這樣的 MIG 設定檔中,「5gb」代表什麼?

此設定檔對分配給實例的計算切片 (1g) 和專用記憶體 (5GB) 進行編碼。

MIG 特別適合哪種工作負載?

當許多小型、孤立的工作負載(例如推理)共享一張卡並保證服務品質時,MIG 就會大放異彩。