GPU-partitionering met meerdere exemplaren
Multi-Instance GPU (MIG) is een NVIDIA-technologie die een enkele fysieke GPU in meerdere geïsoleerde hardwarepartities verdeelt.
Overzicht
It matters because it lets one expensive accelerator serve many small workloads at once without them interfering with each other.
Diepe duik
Geïntroduceerd met de NVIDIA A100 (Ampere) en voortgezet op H100 en nieuwere datacenter-GPU's, verdeelt MIG een GPU in maximaal zeven onafhankelijke instanties. In tegenstelling tot software time-slicing biedt MIG echte hardware-isolatie: elke instantie krijgt zijn eigen speciale streaming multiprocessors (SM's), L2-cache-plakken, geheugencontrollers en een vast stuk geheugen met hoge bandbreedte. Een A100 met 40 GB kan worden opgesplitst in zeven exemplaren van 5 GB, of minder grotere exemplaren. Elke partitie gedraagt zich als een kleinere zelfstandige GPU, zodat een luidruchtige of crashende taak in de ene instantie een andere niet kan verhongeren of beschadigen. Deze gegarandeerde servicekwaliteit maakt MIG ideaal voor inferentiediensten, clusters met meerdere tenants en ontwikkelomgevingen waar veel gebruikers één kaart delen.
Technisch inzicht
MIG werkt door de interne crossbar van de GPU fysiek te poorten, zodat elke instantie een vast pad heeft naar zijn eigen geheugensegment en SM's. NVIDIA definieert profielen als fracties van 1 g,5 GB (één compute-slice, 5 GB) tot 7 g,40 GB. Een GPU-instantie reserveert geheugen en SM's; daarbinnen verdeelt een Compute Instance de SM's verder. Omdat de partities door hardware worden afgedwongen, blijven fouten, ECC-fouten en geheugenbandbreedte beperkt tot één exemplaar.
Strategische impact
Cost and budget
Architectuurbeslissingen bepalen jarenlang de prestaties en bedrijfskosten.
Clearer decisions
Technisch onderwijs helpt teams bij het kiezen van de juiste stapel, niet alleen de nieuwste.
Quality control
Betere technische keuzes verminderen het aantal betrouwbaarheidsincidenten in de productie.
De toekomst van GPU-partitionering met meerdere instanties
Naarmate GPU's groeien naar 80 GB, 141 GB en meer, wordt partitionering aantrekkelijker omdat individuele modellen zelden een hele kaart nodig hebben voor gevolgtrekking. Verwacht strakkere Kubernetes- en cloudintegratie, dynamische herpartitionering zonder het knooppunt leeg te laten lopen, en fijnmaziger profielen. Concurrerende leveranciers streven naar soortgelijke GPU-virtualisatie in SR-IOV-stijl, en serverloze inferentieplatforms vertrouwen steeds meer op partitionering om veel modellen dicht op elkaar te stapelen en inactieve verspilling tegen te gaan.
Implementatie in de echte wereld
Een cloudprovider splitst één A100 op in zeven instances, zodat zeven klanten elk een gegarandeerd, geïsoleerd GPU-segment krijgen voor gevolgtrekking.
Een universitair onderzoekscluster geeft elke promovendus een MIG-instantie van 10 GB voor het maken van prototypen in plaats van het monopoliseren van hele kaarten.
Een inferentieservice verpakt verschillende kleine taal- en visiemodellen op één H100, elk op een eigen partitie met voorspelbare latentie.
Een Kubernetes-cluster adverteert MIG-instanties als planbare bronnen, zodat pods 'nvidia.com/mig-1g.5gb' aanvragen, net als elke andere bron.
Risico's en vangrails
Het optimaliseren van één benchmark kan bredere systeemzwakheden verbergen.
Infrastructuur- en onderhoudskosten worden vaak onderschat.
De lacunes op het gebied van beveiliging en waarneembaarheid kunnen groter worden naarmate systemen complexer worden.
Implementatie routekaart
Definieer latentie-, kwaliteits- en kostendoelen vóór implementatie.
Benchmark onder realistische belasting- en gegevensomstandigheden.
Instrumentbewaking op fouten, drift en gebruikersimpact.
Bereid rollback- en incidentresponspaden voor voordat u gaat schalen.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Instance GPU Partitioning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Leren met meerdere taken
Frequently asked questions
What is Multi-Instance GPU Partitioning?
Multi-Instance GPU (MIG) is een NVIDIA-technologie die een enkele fysieke GPU in meerdere geïsoleerde hardwarepartities verdeelt. Het is belangrijk omdat één dure accelerator veel kleine werklasten tegelijk kan verwerken zonder dat ze elkaar hinderen.
Welk soort isolatie biedt MIG tussen instances?
MIG dwingt isolatie af in de hardware, waarbij SM's, L2-cacheplakken en geheugen aan elke instance worden toegewezen, zodat werklasten er niet in kunnen interfereren.
Op welke NVIDIA-architectuur werd MIG voor het eerst geïntroduceerd?
MIG debuteerde met de Ampere-gebaseerde A100 en ging verder met H100 en latere datacenter-GPU's.
Wat is het maximale aantal instances waarin een MIG-compatibele GPU kan worden opgesplitst?
Een MIG-compatibele GPU zoals de A100 kan worden opgedeeld in maximaal zeven onafhankelijke instanties.
Wat vertegenwoordigt '5gb' in een MIG-profiel zoals '1g.5gb'?
Het profiel codeert voor compute-plakken (1g) en het toegewezen geheugen (5GB) dat aan de instantie wordt gegeven.
Voor welke werklast is MIG vooral geschikt?
MIG schittert wanneer veel kleine, geïsoleerde werklasten (zoals inferentie) één kaart delen met gegarandeerde servicekwaliteit.