テクニカルガイド

マルチインスタンス GPU パーティショニング

マルチインスタンス GPU (MIG) は、単一の物理 GPU を複数の分離されたハードウェア パーティションにスライスする NVIDIA テクノロジです。

2分の読書最終更新日

概要

It matters because it lets one expensive accelerator serve many small workloads at once without them interfering with each other.

ディープダイブ

NVIDIA A100 (Ampere) で導入され、H100 以降のデータセンター GPU で継続されている MIG は、GPU を最大 7 つの独立したインスタンスに分割します。ソフトウェア タイム スライスとは異なり、MIG は真のハードウェア分離を提供します。各インスタンスは、独自の専用ストリーミング マルチプロセッサ (SM)、L2 キャッシュ スライス、メモリ コントローラー、および高帯域幅メモリの固定スライスを取得します。 40GB の A100 は、7 つの 5GB インスタンス、またはそれより少数のより大きなインスタンスに分割できます。各パーティションは小型のスタンドアロン GPU のように動作するため、あるインスタンスでノイズの多いジョブやクラッシュするジョブが別のインスタンスを枯渇させたり破損したりすることはありません。この保証されたサービス品質により、MIG は推論サービス、マルチテナント クラスター、および多くのユーザーが 1 つのカードを共有する開発環境に最適です。

技術的な洞察

MIG は、GPU の内部クロスバーを物理的にゲートすることで機能するため、各インスタンスは独自のメモリ スライスと SM への固定パスを持ちます。 NVIDIA は、プロファイルを 1g.5gb (1 つのコンピューティング スライス、5GB) から 7g.40gb までのような端数として定義します。 GPU インスタンスはメモリと SM を予約します。その中で、コンピューティング インスタンスが SM をさらに細分化します。パーティションはハードウェアによって強制されるため、障害、ECC エラー、メモリ帯域幅は単一のインスタンスに限定されます。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

マルチインスタンス GPU パーティショニングの将来

GPU が 80 GB、141 GB とそれ以上に増加すると、個々のモデルが推論にカード全体を必要とすることがほとんどなくなるため、パーティショニングがより魅力的になります。 Kubernetes とクラウドのより緊密な統合、ノードを消耗させない動的な再パーティショニング、およびよりきめの細かいプロファイルが期待されます。競合ベンダーも同様の SR-IOV スタイルの GPU 仮想化を追求しており、サーバーレス推論プラットフォームは、多くのモデルを高密度にパックして無駄な無駄を削減するためにパーティショニングへの依存度を高めています。

現実世界の実装

クラウド プロバイダーは 1 つの A100 を 7 つのインスタンスに分割するため、7 人の顧客がそれぞれ、推論用に保証された分離された GPU スライスを取得します。

大学の研究クラスターでは、カード全体を独占するのではなく、プロトタイピング用に各博士課程の学生に 10 GB の MIG インスタンスを提供しています。

推論サービスは、複数の小さな言語モデルとビジョン モデルを 1 台の H100 にパックし、それぞれが予測可能な遅延を持つ独自のパーティションにパックされます。

Kubernetes クラスターは MIG インスタンスをスケジュール可能なリソースとしてアドバタイズするため、ポッドは他のリソースと同様に「nvidia.com/mig-1g.5gb」をリクエストします。

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Instance GPU Partitioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

マルチタスク学習

よくある質問

What is Multi-Instance GPU Partitioning?

マルチインスタンス GPU (MIG) は、単一の物理 GPU を複数の分離されたハードウェア パーティションにスライスする NVIDIA テクノロジです。これが重要なのは、1 つの高価なアクセラレータで、相互に干渉することなく、多数の小規模なワークロードを同時に処理できるためです。

MIG はインスタンス間にどのような分離を提供しますか?

MIG はハードウェアでの分離を強制し、SM、L2 キャッシュ スライス、メモリを各インスタンス専用にするため、ワークロードが干渉することはありません。

MIG が最初に導入されたのはどの NVIDIA アーキテクチャですか?

MIG は、Ampere ベースの A100 でデビューし、H100 以降のデータセンター GPU で継続されました。

MIG 対応 GPU を分割できるインスタンスの最大数はどれくらいですか?

A100 などの MIG 対応 GPU は、最大 7 つの独立したインスタンスに分割できます。

「1g.5gb」のような MIG プロファイルの「5gb」は何を表しますか?

このプロファイルは、インスタンスに与えられるコンピューティング スライス (1g) と専用メモリ (5GB) をエンコードします。

MIG はどのワークロードに特に適していますか?

MIG は、多くの小さく分離されたワークロード (推論など) がサービス品質が保証された 1 つのカードを共有する場合に威力を発揮します。