Технічний КЕРІВНИЦТВО

Навчальні стеки DeepSpeed ​​і Megatron

DeepSpeed (Microsoft) і Megatron-LM (NVIDIA) — це стеки програмного забезпечення, які роблять тренувальні моделі з мільярдами параметрів на тисячах графічних процесорів реальними.

2 хвилини читанняОстаннє оновлення

Огляд

Without them, today's frontier models simply could not fit in memory or finish training in a reasonable time.

Глибоке занурення

Навчання великої моделі на одному графічному процесорі неможливо, оскільки ваги, градієнти та стани оптимізатора не підходять. Ці стеки розподіляють роботу між багатьма графічним процесором. Megatron-LM започаткувала тензорний паралелізм, розрізаючи окремі множення матриці всередині кожного шару на графічних процесорах, а також конвеєрний паралелізм, який розміщує різні шари на різних графічних процесорах. Основним внеском DeepSpeed ​​є ZeRO (оптимізатор нульової надлишковості), який розподіляє стани оптимізатора, градієнти та параметри на графічних процесорах замість їх реплікації, різко скорочуючи пам’ять для кожного графічного процесора. Їх часто поєднують (Megatron-DeepSpeed) для навчання таких моделей, як BLOOM-176B і Megatron-Turing NLG. Вони також додають змішану точність, контрольні точки активації та розвантаження на ЦП або NVMe, щоб величезні моделі тренувалися на обмеженому обладнанні.

Технічне розуміння

ZeRO має три етапи збільшення економії пам’яті: Етап 1 сегментує стани оптимізатора, Етап 2 також шардить градієнти, а Етап 3 шардить самі параметри, збираючи їх на вимогу під час проходу вперед і назад. У поєднанні з тензорним паралелізмом (внутрішній шар) і конвеєрним паралелізмом (міжрівень) це утворює «3D-паралелізм». Основна напруга полягає в накладних витратах на зв’язок: кожне розбиття сегментів додає трафік GPU-GPU, тож інженери налаштовують розподіл, щоб підтримувати швидкі зв’язки NVLink і InfiniBand насиченими.

Стратегічний вплив

Вартість і бюджет

Архітектурні рішення збільшують продуктивність і експлуатаційні витрати протягом багатьох років.

Чіткіші рішення

Технічна освіта допомагає командам вибрати правильний стек, а не лише найновіший.

Контроль якості

Кращий інженерний вибір зменшує проблеми з надійністю у виробництві.

Майбутнє навчальних стеків DeepSpeed і Megatron

Очікуйте більш тісної інтеграції з рідною FSDP PyTorch (Fully Sharded Data Parallel), яка увібрала багато ідей ZeRO, стираючи межу між дослідницькими стеками та базовими фреймворками. Підходи, керовані компілятором, і автоматичні планувальники паралелізму спрямовані на усунення ручного налаштування. Оскільки навчальні кластери зростають до сотень тисяч прискорювачів, відмовостійкість, еластичне масштабування та перекриття зв’язку з обчисленнями стають домінуючими інженерними межами, поряд із підтримкою нового апаратного забезпечення, наприклад NVIDIA Blackwell, і спеціальних навчальних чіпів.

Реалізація в реальному світі

Навчання відкритої багатомовної моделі BLOOM-176B з використанням комбінованого стеку Megatron-DeepSpeed ​​на сотнях GPU.

Microsoft та NVIDIA тренують модель Megatron-Turing NLG із 530 мільярдами параметрів із 3D-паралелізмом.

ZeRO-Offload дозволяє дослідникам точно налаштовувати моделі з кількома мільярдами параметрів на одному графічному процесорі робочої станції шляхом перенесення станів оптимізатора на оперативну пам’ять ЦП.

Використання контрольних точок активації в цих стеках, щоб відповідати довшим контекстним вікнам шляхом повторного обчислення активацій замість того, щоб зберігати їх усі.

Ризики та огорожі

Оптимізація одного тесту може приховати ширші слабкі сторони системи.

Витрати на інфраструктуру та обслуговування часто недооцінюються.

Прогалини в безпеці та спостережуваності можуть зростати в міру ускладнення систем.

Дорожня карта впровадження

1

Визначте цільові показники затримки, якості та вартості перед впровадженням.

2

Тест за реалістичних умов навантаження та даних.

3

Моніторинг інструментів на наявність помилок, дрейфу та впливу користувача.

4

Перед масштабуванням підготуйте шляхи відкату та реагування на інциденти.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DeepSpeed and Megatron Training Stacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Квантування GPTQ і AWQ після навчання

Часті запитання

What is DeepSpeed and Megatron Training Stacks?

DeepSpeed (Microsoft) і Megatron-LM (NVIDIA) — це стеки програмного забезпечення, які роблять тренувальні моделі з мільярдами параметрів на тисячах графічних процесорів реальними. Без них сучасні прикордонні моделі просто не змогли б укластися в пам'яті або завершити навчання в прийнятний термін.

Яке основне призначення оптимізатора ZeRO від DeepSpeed?

ZeRO (оптимізатор нульової надлишковості) усуває надмірність пам’яті, розподіляючи стани оптимізатора, градієнти та параметри між графічним процесором, а не копіюючи їх на кожному пристрої.

Як тензорний паралелізм, запроваджений у Megatron-LM, розбиває модель?

Тензорний паралелізм розділяє математику всередині одного шару (наприклад, множення великої матриці) на кілька графічних процесорів, що є внутрішньорівневим поділом.

Який етап ZeRO забезпечує найбільше заощадження пам’яті завдяки шардингу самих параметрів моделі?

ZeRO Stage 3 сегментує параметри на додаток до градієнтів і станів оптимізатора, збираючи їх на вимогу, забезпечуючи найбільше скорочення пам’яті.

Що дає «контрольна точка активації» для збереження пам’яті під час навчання?

Контрольні точки активації зберігають менше проміжних активацій і повторно обчислюють їх під час зворотного розповсюдження, обмінюючи додаткові обчислення на зменшену пам’ять.

Чому поєднання цих методів часто називають «3D-паралелізмом»?

Тривимірний паралелізм об’єднує три ортогональні стратегії: паралелізм даних, тензорний (внутрішньошаровий) паралелізм і конвеєрний (міжрівневий) паралелізм.