GUIDA TECNICA

Partizionamento GPU multiistanza

Multi-Instance GPU (MIG) è una tecnologia NVIDIA che suddivide una singola GPU fisica in più partizioni hardware isolate.

2 minuti di letturaUltimo aggiornamento

Panoramica

It matters because it lets one expensive accelerator serve many small workloads at once without them interfering with each other.

Immersione profonda

Introdotto con NVIDIA A100 (Ampere) e continuato su H100 e sulle GPU per data center più recenti, MIG suddivide una GPU in un massimo di sette istanze indipendenti. A differenza del time-slicing del software, MIG fornisce un vero isolamento hardware: ogni istanza ottiene i propri multiprocessori di streaming (SM) dedicati, sezioni di cache L2, controller di memoria e una sezione fissa di memoria a larghezza di banda elevata. Un A100 con 40 GB può essere suddiviso in sette istanze da 5 GB o meno istanze più grandi. Ogni partizione si comporta come una GPU autonoma più piccola, quindi un lavoro rumoroso o che si blocca in un'istanza non può affamare o corrompere un'altra. Questa qualità di servizio garantita rende MIG ideale per il servizio di inferenza, i cluster multi-tenant e gli ambienti di sviluppo in cui molti utenti condividono una scheda.

Approfondimento tecnico

MIG funziona collegando fisicamente la barra trasversale interna della GPU in modo che ogni istanza abbia un percorso fisso verso la propria porzione di memoria e i propri SM. NVIDIA definisce i profili come frazioni come 1 g,5 GB (una porzione di calcolo, 5 GB) fino a 7 g,40 GB. Un'istanza GPU riserva memoria e SM; al suo interno una Compute Instance suddivide ulteriormente gli SM. Poiché le partizioni sono applicate dall'hardware, i guasti, gli errori ECC e la larghezza di banda della memoria rimangono confinati in una singola istanza.

Impatto strategico

Costo e budget

Le decisioni relative all'architettura determinano prestazioni e costi operativi per anni.

Decisioni più chiare

La formazione tecnica aiuta i team a scegliere lo stack giusto, non solo quello più nuovo.

Controllo di qualità

Migliori scelte ingegneristiche riducono gli incidenti legati all’affidabilità nella produzione.

Il futuro del partizionamento GPU multiistanza

Man mano che le GPU crescono fino a 80 GB, 141 GB e oltre, il partizionamento diventa più interessante perché i singoli modelli raramente necessitano di un'intera scheda per l'inferenza. Aspettatevi una più stretta integrazione tra Kubernetes e cloud, ripartizionamento dinamico senza svuotare il nodo e profili a grana più fine. I fornitori concorrenti stanno perseguendo una virtualizzazione GPU simile in stile SR-IOV e le piattaforme di inferenza serverless si affidano sempre più al partizionamento per compattare molti modelli e ridurre gli sprechi inattivi.

Implementazione nel mondo reale

Un fornitore di servizi cloud divide un A100 in sette istanze in modo che sette clienti ricevano ciascuno una porzione di GPU isolata e garantita per l'inferenza.

Un cluster di ricerca universitario fornisce a ogni studente di dottorato un'istanza MIG da 10 GB per la prototipazione invece di monopolizzare intere carte.

Un servizio di inferenza racchiude diversi piccoli modelli linguistici e visivi in ​​un H100, ciascuno nella propria partizione con latenza prevedibile.

Un cluster Kubernetes pubblicizza le istanze MIG come risorse pianificabili in modo che i pod richiedano "nvidia.com/mig-1g.5gb" come qualsiasi altra risorsa.

Rischi e guardrail

L'ottimizzazione di un benchmark può nascondere debolezze di sistema più ampie.

I costi delle infrastrutture e della manutenzione sono spesso sottostimati.

Le lacune in termini di sicurezza e osservabilità possono aumentare man mano che i sistemi diventano più complessi.

Tabella di marcia per l'implementazione

1

Definire obiettivi di latenza, qualità e costi prima dell'implementazione.

2

Benchmark in condizioni di carico e dati realistiche.

3

Monitoraggio dello strumento per errori, deriva e impatto sull'utente.

4

Preparare percorsi di rollback e risposta agli incidenti prima della scalabilità.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Instance GPU Partitioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Apprendimento multitasking

Domande frequenti

What is Multi-Instance GPU Partitioning?

Multi-Instance GPU (MIG) è una tecnologia NVIDIA che suddivide una singola GPU fisica in più partizioni hardware isolate. È importante perché consente a un costoso acceleratore di gestire molti piccoli carichi di lavoro contemporaneamente senza che interferiscano tra loro.

Che tipo di isolamento fornisce MIG tra le istanze?

MIG impone l'isolamento nell'hardware, dedicando SM, porzioni di cache L2 e memoria a ciascuna istanza in modo che i carichi di lavoro non possano interferire.

Su quale architettura NVIDIA è stata introdotta per la prima volta MIG?

MIG ha debuttato con l'A100 basato su Ampere e ha continuato con l'H100 e le successive GPU per data center.

Qual è il numero massimo di istanze in cui può essere suddivisa una GPU compatibile con MIG?

Una GPU compatibile con MIG come l'A100 può essere partizionata in un massimo di sette istanze indipendenti.

In un profilo MIG come "1g.5gb", cosa rappresenta "5gb"?

Il profilo codifica le porzioni di calcolo (1 g) e la memoria dedicata (5 GB) assegnata all'istanza.

Per quale carico di lavoro la MIG è particolarmente adatta?

MIG brilla quando molti carichi di lavoro piccoli e isolati (come l'inferenza) condividono un'unica scheda con qualità di servizio garantita.