技术指南

多实例GPU分区

多实例 GPU (MIG) 是一项 NVIDIA 技术,可将单个物理 GPU 分割为多个独立的硬件分区。

阅读时间:2分钟最后更新

概述

It matters because it lets one expensive accelerator serve many small workloads at once without them interfering with each other.

深入探讨

MIG 随 NVIDIA A100 (Ampere) 推出,并在 H100 和更新的数据中心 GPU 上继续使用,将 GPU 划分为最多七个独立实例。与软件时间切片不同,MIG 提供真正的硬件隔离:每个实例都有自己的专用流式多处理器 (SM)、L2 缓存切片、内存控制器和固定的高带宽内存切片。 40GB 的 A100 可以拆分为七个 5GB 实例,或更少的较大实例。每个分区的行为就像一个较小的独立 GPU,因此一个实例中的嘈杂或崩溃的作业不会导致另一个实例挨饿或损坏。这种有保证的服务质量使 MIG 非常适合推理服务、多租户集群以及许多用户共享一张卡的开发环境。

技术洞察

MIG 的工作原理是物理门控 GPU 的内部交叉开关,因此每个实例都有一条通往其自己的内存片和 SM 的固定路径。 NVIDIA 将配置文件定义为分数,例如 1g.5gb(一个计算切片,5GB)到 7g.40gb。 GPU实例保留内存和SM;其中计算实例进一步细分 SM。由于分区是硬件强制的,因此故障、ECC 错误和内存带宽仅限于单个实例。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

多实例 GPU 分区的未来

随着 GPU 增长到 80GB、141GB 甚至更高,分区变得更具吸引力,因为单个模型很少需要整张卡进行推理。期待更紧密的 Kubernetes 和云集成、无需耗尽节点的动态重新分区以及更细粒度的配置文件。竞争厂商正在追求类似的 SR-IOV 式 GPU 虚拟化,无服务器推理平台越来越依赖分区来密集打包许多模型并减少闲置浪费。

现实世界的实施

一家云提供商将一个 A100 拆分为七个实例,以便七个客户每个都获得一个有保证的、独立的 GPU 切片用于推理。

大学研究集群为每个博士生提供一个 10GB MIG 实例用于原型设计,而不是独占整张卡。

推理服务将多个小型语言和视觉模型打包到一个 H100 上,每个模型都位于自己的分区中,具有可预测的延迟。

Kubernetes 集群将 MIG 实例宣传为可调度资源,因此 Pod 会像任何其他资源一样请求“nvidia.com/mig-1g.5gb”。

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Instance GPU Partitioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

多任务学习

常见问题

What is Multi-Instance GPU Partitioning?

多实例 GPU (MIG) 是一项 NVIDIA 技术,可将单个物理 GPU 分割为多个独立的硬件分区。这很重要,因为它可以让一个昂贵的加速器同时处理许多小型工作负载,而不会相互干扰。

MIG 在实例之间提供什么样的隔离?

MIG 强制实施硬件隔离,将 SM、L2 缓存片和内存专用于每个实例,以便工作负载不会干扰。

MIG 首次在哪种 NVIDIA 架构上引入?

MIG 首次推出基于 Ampere 的 A100,并在 H100 和后来的数据中心 GPU 上继续发展。

支持 MIG 的 GPU 最多可以拆分为多少个实例?

支持 MIG 的 GPU(例如 A100)可以划分为最多七个独立实例。

在“1g.5gb”这样的 MIG 配置文件中,“5gb”代表什么?

该配置文件对分配给实例的计算切片 (1g) 和专用内存 (5GB) 进行编码。

MIG 特别适合哪种工作负载?

当许多小型、孤立的工作负载(例如推理)共享一张卡并保证服务质量时,MIG 就会大放异彩。