Technische GIDS

GPU-partitionering met meerdere exemplaren

Multi-Instance GPU (MIG) is een NVIDIA-technologie die een enkele fysieke GPU in meerdere geïsoleerde hardwarepartities verdeelt.

2 min readLaatst bijgewerkt

Overzicht

It matters because it lets one expensive accelerator serve many small workloads at once without them interfering with each other.

Diepe duik

Geïntroduceerd met de NVIDIA A100 (Ampere) en voortgezet op H100 en nieuwere datacenter-GPU's, verdeelt MIG een GPU in maximaal zeven onafhankelijke instanties. In tegenstelling tot software time-slicing biedt MIG echte hardware-isolatie: elke instantie krijgt zijn eigen speciale streaming multiprocessors (SM's), L2-cache-plakken, geheugencontrollers en een vast stuk geheugen met hoge bandbreedte. Een A100 met 40 GB kan worden opgesplitst in zeven exemplaren van 5 GB, of minder grotere exemplaren. Elke partitie gedraagt ​​zich als een kleinere zelfstandige GPU, zodat een luidruchtige of crashende taak in de ene instantie een andere niet kan verhongeren of beschadigen. Deze gegarandeerde servicekwaliteit maakt MIG ideaal voor inferentiediensten, clusters met meerdere tenants en ontwikkelomgevingen waar veel gebruikers één kaart delen.

Technisch inzicht

MIG werkt door de interne crossbar van de GPU fysiek te poorten, zodat elke instantie een vast pad heeft naar zijn eigen geheugensegment en SM's. NVIDIA definieert profielen als fracties van 1 g,5 GB (één compute-slice, 5 GB) tot 7 g,40 GB. Een GPU-instantie reserveert geheugen en SM's; daarbinnen verdeelt een Compute Instance de SM's verder. Omdat de partities door hardware worden afgedwongen, blijven fouten, ECC-fouten en geheugenbandbreedte beperkt tot één exemplaar.

Strategische impact

Cost and budget

Architectuurbeslissingen bepalen jarenlang de prestaties en bedrijfskosten.

Clearer decisions

Technisch onderwijs helpt teams bij het kiezen van de juiste stapel, niet alleen de nieuwste.

Quality control

Betere technische keuzes verminderen het aantal betrouwbaarheidsincidenten in de productie.

De toekomst van GPU-partitionering met meerdere instanties

Naarmate GPU's groeien naar 80 GB, 141 GB en meer, wordt partitionering aantrekkelijker omdat individuele modellen zelden een hele kaart nodig hebben voor gevolgtrekking. Verwacht strakkere Kubernetes- en cloudintegratie, dynamische herpartitionering zonder het knooppunt leeg te laten lopen, en fijnmaziger profielen. Concurrerende leveranciers streven naar soortgelijke GPU-virtualisatie in SR-IOV-stijl, en serverloze inferentieplatforms vertrouwen steeds meer op partitionering om veel modellen dicht op elkaar te stapelen en inactieve verspilling tegen te gaan.

Implementatie in de echte wereld

Een cloudprovider splitst één A100 op in zeven instances, zodat zeven klanten elk een gegarandeerd, geïsoleerd GPU-segment krijgen voor gevolgtrekking.

Een universitair onderzoekscluster geeft elke promovendus een MIG-instantie van 10 GB voor het maken van prototypen in plaats van het monopoliseren van hele kaarten.

Een inferentieservice verpakt verschillende kleine taal- en visiemodellen op één H100, elk op een eigen partitie met voorspelbare latentie.

Een Kubernetes-cluster adverteert MIG-instanties als planbare bronnen, zodat pods 'nvidia.com/mig-1g.5gb' aanvragen, net als elke andere bron.

Risico's en vangrails

Het optimaliseren van één benchmark kan bredere systeemzwakheden verbergen.

Infrastructuur- en onderhoudskosten worden vaak onderschat.

De lacunes op het gebied van beveiliging en waarneembaarheid kunnen groter worden naarmate systemen complexer worden.

Implementatie routekaart

1

Definieer latentie-, kwaliteits- en kostendoelen vóór implementatie.

2

Benchmark onder realistische belasting- en gegevensomstandigheden.

3

Instrumentbewaking op fouten, drift en gebruikersimpact.

4

Bereid rollback- en incidentresponspaden voor voordat u gaat schalen.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Instance GPU Partitioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Leren met meerdere taken

Frequently asked questions

What is Multi-Instance GPU Partitioning?

Multi-Instance GPU (MIG) is een NVIDIA-technologie die een enkele fysieke GPU in meerdere geïsoleerde hardwarepartities verdeelt. Het is belangrijk omdat één dure accelerator veel kleine werklasten tegelijk kan verwerken zonder dat ze elkaar hinderen.

Welk soort isolatie biedt MIG tussen instances?

MIG dwingt isolatie af in de hardware, waarbij SM's, L2-cacheplakken en geheugen aan elke instance worden toegewezen, zodat werklasten er niet in kunnen interfereren.

Op welke NVIDIA-architectuur werd MIG voor het eerst geïntroduceerd?

MIG debuteerde met de Ampere-gebaseerde A100 en ging verder met H100 en latere datacenter-GPU's.

Wat is het maximale aantal instances waarin een MIG-compatibele GPU kan worden opgesplitst?

Een MIG-compatibele GPU zoals de A100 kan worden opgedeeld in maximaal zeven onafhankelijke instanties.

Wat vertegenwoordigt '5gb' in een MIG-profiel zoals '1g.5gb'?

Het profiel codeert voor compute-plakken (1g) en het toegewezen geheugen (5GB) dat aan de instantie wordt gegeven.

Voor welke werklast is MIG vooral geschikt?

MIG schittert wanneer veel kleine, geïsoleerde werklasten (zoals inferentie) één kaart delen met gegarandeerde servicekwaliteit.