Технічний КЕРІВНИЦТВО

Багатоекземплярне розділення GPU

Multi-Instance GPU (MIG) — це технологія NVIDIA, яка розділяє один фізичний GPU на кілька ізольованих апаратних розділів.

2 хвилини читанняОстаннє оновлення

Огляд

It matters because it lets one expensive accelerator serve many small workloads at once without them interfering with each other.

Глибоке занурення

Представлений у NVIDIA A100 (Ampere) і продовжений на H100 та новіших графічних процесорах центрів обробки даних, MIG розділяє графічний процесор на сім незалежних екземплярів. На відміну від програмного розподілу часу, MIG забезпечує справжню апаратну ізоляцію: кожен екземпляр отримує власні виділені потокові мультипроцесори (SM), фрагменти кешу L2, контролери пам’яті та фіксований фрагмент пам’яті з високою пропускною здатністю. A100 з 40 ГБ можна розділити на сім примірників по 5 ГБ або менше більших. Кожен розділ поводиться як менший автономний графічний процесор, тому робота з шумом або збоями в одному екземплярі не може призвести до погіршення чи пошкодження іншого. Ця гарантована якість обслуговування робить MIG ідеальним для обслуговування логічних висновків, кластерів із кількома клієнтами та середовищ розробки, де багато користувачів використовують одну картку.

Технічне розуміння

MIG працює, фізично перекриваючи внутрішню перемичку графічного процесора, щоб кожен екземпляр мав фіксований шлях до власного фрагмента пам’яті та SM. NVIDIA визначає профілі як частки, такі як 1g.5gb (один обчислювальний фрагмент, 5GB) до 7g.40gb. Екземпляр GPU резервує пам’ять і SM; всередині нього Compute Instance додатково поділяє SM. Оскільки розділи підтримуються апаратним забезпеченням, помилки, помилки ECC і пропускна здатність пам’яті залишаються обмеженими одним екземпляром.

Стратегічний вплив

Вартість і бюджет

Архітектурні рішення збільшують продуктивність і експлуатаційні витрати протягом багатьох років.

Чіткіші рішення

Технічна освіта допомагає командам вибрати правильний стек, а не лише найновіший.

Контроль якості

Кращий інженерний вибір зменшує проблеми з надійністю у виробництві.

Майбутнє багатоекземплярного розділення GPU

Оскільки графічні процесори збільшуються до 80 ГБ, 141 ГБ і більше, розділення стає більш привабливим, оскільки окремі моделі рідко потребують цілої карти для висновку. Очікуйте тіснішої інтеграції Kubernetes і хмари, динамічного перерозподілу без виснаження вузла та більш детальних профілів. Конкуруючі постачальники прагнуть подібної віртуалізації GPU у стилі SR-IOV, а платформи безсерверного висновку все більше покладаються на розділення, щоб щільно розміщувати багато моделей і зменшувати витрати простою.

Реалізація в реальному світі

Хмарний постачальник розбиває один A100 на сім екземплярів, щоб кожен із семи клієнтів отримав гарантований ізольований фрагмент GPU для висновку.

Університетський дослідницький кластер надає кожному аспіранту екземпляр MIG на 10 ГБ для прототипування замість того, щоб монополізувати цілі карти.

Служба логічного висновку об’єднує кілька невеликих моделей мови та зору в один H100, кожну у своєму розділі з передбачуваною затримкою.

Кластер Kubernetes рекламує екземпляри MIG як заплановані ресурси, тому модулі запитують «nvidia.com/mig-1g.5gb», як і будь-який інший ресурс.

Ризики та огорожі

Оптимізація одного тесту може приховати ширші слабкі сторони системи.

Витрати на інфраструктуру та обслуговування часто недооцінюються.

Прогалини в безпеці та спостережуваності можуть зростати в міру ускладнення систем.

Дорожня карта впровадження

1

Визначте цільові показники затримки, якості та вартості перед впровадженням.

2

Тест за реалістичних умов навантаження та даних.

3

Моніторинг інструментів на наявність помилок, дрейфу та впливу користувача.

4

Перед масштабуванням підготуйте шляхи відкату та реагування на інциденти.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Instance GPU Partitioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Багатозадачне навчання

Часті запитання

What is Multi-Instance GPU Partitioning?

Multi-Instance GPU (MIG) — це технологія NVIDIA, яка розділяє один фізичний GPU на кілька ізольованих апаратних розділів. Це важливо, оскільки він дозволяє одному дорогому прискорювачу обслуговувати багато невеликих робочих навантажень одночасно, не заважаючи один одному.

Яку ізоляцію забезпечує MIG між примірниками?

MIG забезпечує ізоляцію в апаратному забезпеченні, виділяючи SM, сегменти кешу L2 і пам’ять для кожного екземпляра, щоб робочі навантаження не заважали.

На якій архітектурі NVIDIA вперше було представлено MIG?

MIG дебютувала з A100 на базі Ampere і продовжила роботу на H100 і пізніших графічних процесорах центрів обробки даних.

На яку максимальну кількість екземплярів може бути розділений графічний процесор із підтримкою MIG?

Графічний процесор із підтримкою MIG, такий як A100, може бути розділений на сім незалежних екземплярів.

У профілі MIG, наприклад «1g.5gb», що означає «5gb»?

Профіль кодує обчислювальні фрагменти (1 г) і виділену пам’ять (5 ГБ), надану екземпляру.

Для яких навантажень MIG особливо підходить?

MIG сяє, коли багато невеликих ізольованих робочих навантажень (наприклад, висновків) використовують одну картку з гарантованою якістю обслуговування.