Multi-instans GPU-partisjonering
Multi-Instance GPU (MIG) er en NVIDIA-teknologi som deler en enkelt fysisk GPU i flere isolerte maskinvarepartisjoner.
Oversikt
It matters because it lets one expensive accelerator serve many small workloads at once without them interfering with each other.
Dypdykk
Introdusert med NVIDIA A100 (Ampere) og videreført på H100 og nyere datasenter-GPUer, deler MIG ut en GPU i opptil syv uavhengige instanser. I motsetning til programvaretidsslicing, gir MIG ekte maskinvareisolasjon: hver forekomst får sine egne dedikerte streaming-multiprosessorer (SM-er), L2-cache-slicer, minnekontrollere og en fast del av høybåndbredde-minne. En A100 med 40 GB kan deles opp i syv 5 GB-forekomster, eller færre større. Hver partisjon oppfører seg som en mindre frittstående GPU, så en støyende eller krasjende jobb i ett tilfelle kan ikke sulte eller ødelegge en annen. Denne garanterte tjenestekvaliteten gjør MIG ideell for slutningsservering, multi-tenant-klynger og utviklingsmiljøer der mange brukere deler ett kort.
Teknisk innsikt
MIG fungerer ved fysisk å blokkere GPUens interne tverrstang slik at hver forekomst har en fast bane til sin egen minnedel og SM-er. NVIDIA definerer profiler som brøkdeler som 1g.5gb (én beregningsskive, 5GB) opp til 7g.40gb. En GPU-instans reserverer minne og SMS; innenfor den deler en Compute Instance SM-ene ytterligere. Fordi partisjonene er maskinvare-håndhevet, forblir feil, ECC-feil og minnebåndbredde begrenset til en enkelt forekomst.
Strategisk innvirkning
Cost and budget
Arkitekturbeslutninger driver ytelse og driftskostnader i årevis.
Tydeligere avgjørelser
Teknisk utdanning hjelper team med å velge riktig stabel, ikke bare den nyeste.
Quality control
Bedre ingeniørvalg reduserer pålitelighetshendelser i produksjonen.
Fremtiden for multi-instans GPU-partisjonering
Ettersom GPU-er vokser til 80 GB, 141 GB og utover, blir partisjonering mer attraktivt fordi individuelle modeller sjelden trenger et helt kort for å konkludere. Forvent tettere Kubernetes og skyintegrasjon, dynamisk ompartisjonering uten å tømme noden, og mer detaljerte profiler. Konkurrerende leverandører forfølger lignende SR-IOV-stil GPU-virtualisering, og serverløse slutningsplattformer er i økende grad avhengige av partisjonering for å pakke mange modeller tett og kutte ledig avfall.
Real-World Implementering
En skyleverandør deler én A100 i syv forekomster, slik at syv kunder hver får en garantert, isolert GPU-del for slutning.
En universitetsforskningsklynge gir hver PhD-student en 10 GB MIG-instans for prototyping i stedet for å monopolisere hele kort.
En slutningstjeneste pakker flere små språk- og synsmodeller på én H100, hver i sin egen partisjon med forutsigbar latens.
En Kubernetes-klynge annonserer MIG-forekomster som planlagte ressurser, så pods ber om 'nvidia.com/mig-1g.5gb' som enhver annen ressurs.
Risikoer og rekkverk
Optimalisering av ett benchmark kan skjule bredere systemsvakheter.
Infrastruktur- og vedlikeholdskostnader er ofte undervurdert.
Sikkerhets- og observerbarhetsgap kan vokse etter hvert som systemene blir mer komplekse.
Veikart for implementering
Definer ventetid, kvalitet og kostnadsmål før implementering.
Benchmark under realistiske belastnings- og dataforhold.
Instrumentovervåking for feil, drift og brukerpåvirkning.
Forbered tilbakerulling og hendelsesresponsbaner før skalering.
Fortsett å utforske
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Instance GPU Partitioning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Neste guide
Multi-Task læring
Ofte stilte spørsmål
What is Multi-Instance GPU Partitioning?
Multi-Instance GPU (MIG) er en NVIDIA-teknologi som deler en enkelt fysisk GPU i flere isolerte maskinvarepartisjoner. Det er viktig fordi det lar én dyr akselerator betjene mange små arbeidsbelastninger samtidig uten at de forstyrrer hverandre.
Hva slags isolasjon gir MIG mellom forekomster?
MIG fremtvinger isolasjon i maskinvare, dedikerer SM-er, L2-bufferstykker og minne til hver forekomst slik at arbeidsbelastninger ikke kan forstyrre.
På hvilken NVIDIA-arkitektur ble MIG først introdusert?
MIG debuterte med den Ampere-baserte A100 og fortsatte på H100 og senere datasenter-GPUer.
Hva er det maksimale antallet forekomster en MIG-kompatibel GPU kan deles inn i?
En MIG-kompatibel GPU som A100 kan deles inn i opptil syv uavhengige instanser.
I en MIG-profil som '1g.5gb', hva representerer '5gb'?
Profilen koder for beregningsstykker (1g) og det dedikerte minnet (5GB) gitt til forekomsten.
Hvilken arbeidsmengde er MIG spesielt godt egnet for?
MIG skinner når mange små, isolerte arbeidsbelastninger (som slutninger) deler ett kort med garantert servicekvalitet.