Техническо РЪКОВОДСТВО

Мултиинстанционно GPU разделяне

Multi-Instance GPU (MIG) е технология на NVIDIA, която разделя един физически GPU на множество изолирани хардуерни дялове.

2 min readПоследна актуализация

Преглед

It matters because it lets one expensive accelerator serve many small workloads at once without them interfering with each other.

Дълбоко гмуркане

Въведен с NVIDIA A100 (Ampere) и продължен на H100 и по-нови графични процесори за центрове за данни, MIG разделя GPU в до седем независими инстанции. За разлика от софтуерното разрязване на времето, MIG осигурява истинска хардуерна изолация: всеки екземпляр получава свои собствени специални мултипроцесори за поточно предаване (SM), L2 кеш срезове, контролери на паметта и фиксиран срез с памет с висока честотна лента. A100 с 40 GB може да бъде разделен на седем екземпляра от 5 GB или по-малко по-големи. Всеки дял се държи като по-малък самостоятелен GPU, така че шумна или сриваща се работа в един случай не може да изглади или повреди друг. Това гарантирано качество на услугата прави MIG идеален за обслужване на изводи, клъстери с множество клиенти и среди за разработка, където много потребители споделят една карта.

Техническа информация

MIG работи чрез физическо свързване на вътрешната напречна лента на графичния процесор, така че всеки екземпляр има фиксиран път до собствения си срез на паметта и SM. NVIDIA дефинира профили като фракции като 1g.5gb (един изчислителен сегмент, 5GB) до 7g.40gb. Инстанция на GPU запазва памет и SM; в него Compute Instance допълнително разделя SM. Тъй като дяловете са хардуерно принудени, грешките, ECC грешките и честотната лента на паметта остават ограничени до един екземпляр.

Стратегическо въздействие

Cost and budget

Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.

Clearer decisions

Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.

Quality control

По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.

Бъдещето на разделянето на GPU с няколко инстанции

Тъй като графичните процесори нарастват до 80GB, 141GB и повече, разделянето става по-привлекателно, тъй като отделните модели рядко се нуждаят от цяла карта за извод. Очаквайте по-тясна интеграция на Kubernetes и облака, динамично преразпределяне без изтощаване на възела и по-фини профили. Конкурентните доставчици се стремят към подобна GPU виртуализация в стил SR-IOV, а платформите за изводи без сървър все повече разчитат на разделяне, за да опаковат много модели плътно и да намалят загубата на неактивни данни.

Внедряване в реалния свят

Доставчик на облак разделя един A100 на седем екземпляра, така че всеки седем клиента да получи гарантиран, изолиран GPU срез за извод.

Университетски изследователски клъстер дава на всеки докторант 10GB MIG екземпляр за създаване на прототипи, вместо да монополизира цели карти.

Услуга за извод пакетира няколко малки езикови и визуални модела в един H100, всеки в собствен дял с предсказуема латентност.

Клъстер на Kubernetes рекламира екземпляри на MIG като планирани ресурси, така че подовете изискват „nvidia.com/mig-1g.5gb“ като всеки друг ресурс.

Рискове и предпазни огради

Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.

Разходите за инфраструктура и поддръжка често се подценяват.

Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.

Пътна карта за изпълнение

1

Определете целите за латентност, качество и разходи преди внедряването.

2

Бенчмарк при реалистични условия на натоварване и данни.

3

Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.

4

Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Instance GPU Partitioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Многозадачно обучение

Frequently asked questions

What is Multi-Instance GPU Partitioning?

Multi-Instance GPU (MIG) е технология на NVIDIA, която разделя един физически GPU на множество изолирани хардуерни дялове. Има значение, защото позволява на един скъп ускорител да обслужва много малки работни натоварвания наведнъж, без те да си пречат един на друг.

Какъв вид изолация осигурява MIG между екземплярите?

MIG налага изолация в хардуера, като отделя SM, L2 кеш срезове и памет за всеки екземпляр, така че работните натоварвания да не могат да се намесват.

На коя архитектура на NVIDIA е представен за първи път MIG?

MIG дебютира с базирания на Ampere A100 и продължи с H100 и по-късни графични процесори за центрове за данни.

Какъв е максималният брой екземпляри, на които може да бъде разделен съвместим с MIG GPU?

MIG-съвместим GPU като A100 може да бъде разделен на до седем независими екземпляра.

В MIG профил като „1g.5gb“, какво представлява „5gb“?

Профилът кодира изчислителни сегменти (1g) и специалната памет (5GB), предоставена на инстанцията.

За какво работно натоварване е особено подходящ MIG?

MIG блести, когато много малки, изолирани работни натоварвания (като изводи) споделят една карта с гарантирано качество на услугата.