Техническое РУКОВОДСТВО

Учебные стеки DeepSpeed ​​и Megatron

DeepSpeed (Microsoft) и Megatron-LM (NVIDIA) — это программные стеки, которые делают реальными модели обучения с миллиардами параметров для тысяч графических процессоров.

2 минуты чтенияПоследнее обновление

Обзор

Without them, today's frontier models simply could not fit in memory or finish training in a reasonable time.

Глубокое погружение

Обучение большой модели на одном графическом процессоре невозможно, поскольку веса, градиенты и состояния оптимизатора не подходят. Эти стеки распределяют работу между многими графическими процессорами. Megatron-LM был пионером в тензорном параллелизме, разделяющем отдельные матричные умножения внутри каждого слоя на графические процессоры, а также конвейерном параллелизме, который помещает разные уровни на разные графические процессоры. Отличительной особенностью DeepSpeed ​​является ZeRO (Zero Redundancy Optimizer), который распределяет состояния, градиенты и параметры оптимизатора по графическим процессорам вместо их репликации, что резко сокращает память каждого графического процессора. Их часто комбинируют (Megatron-DeepSpeed) для обучения таких моделей, как BLOOM-176B и Megatron-Turing NLG. Они также добавляют смешанную точность, контрольные точки активации и разгрузку на ЦП или NVMe, поэтому огромные модели тренируются на ограниченном оборудовании.

Техническая информация

ZeRO имеет три этапа увеличения экономии памяти: этап 1 сегментирует состояния оптимизатора, этап 2 также сегментирует градиенты, а этап 3 сегментирует сами параметры, собирая их по требованию во время прямых и обратных проходов. В сочетании с тензорным параллелизмом (внутриуровневым) и конвейерным параллелизмом (межуровневым) это образует «3D-параллелизм». Ключевым моментом являются накладные расходы на связь: каждое разделение сегментов увеличивает трафик между графическими процессорами, поэтому инженеры настраивают разделение так, чтобы быстрые каналы NVLink и InfiniBand оставались насыщенными.

Стратегическое воздействие

Стоимость и бюджет

Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.

Более четкие решения

Техническое образование помогает командам выбрать правильный стек, а не только самый новый.

Контроль качества

Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.

Будущее тренировочных стеков DeepSpeed и Megatron

Ожидайте более тесной интеграции с собственным FSDP (Fully Sharded Data Parallel) PyTorch, который вобрал в себя многие идеи ZeRO, стирая грань между стеками исследований и основными платформами. Подходы, управляемые компилятором, и автоматические планировщики параллелизма направлены на устранение ручной настройки. По мере того как обучающие кластеры растут до сотен тысяч ускорителей, отказоустойчивость, эластичное масштабирование и перекрытие связи с вычислениями становятся доминирующими инженерными задачами, наряду с поддержкой нового оборудования, такого как NVIDIA Blackwell и специализированных обучающих чипов.

Реальная реализация

Обучение открытой многоязычной модели BLOOM-176B с использованием объединенного стека Megatron-DeepSpeed ​​на сотнях графических процессоров.

Microsoft и NVIDIA обучают модель NLG Мегатрона-Тьюринга с 530 миллиардами параметров с помощью 3D-параллелизма.

ZeRO-Offload позволяет исследователям точно настраивать модели с несколькими миллиардами параметров на одном графическом процессоре рабочей станции, передавая состояния оптимизатора в оперативную память процессора.

Использование контрольных точек активации в этих стеках для размещения более длинных контекстных окон путем повторного расчета активаций вместо их сохранения.

Риски и ограничения

Оптимизация одного теста может скрыть более широкие недостатки системы.

Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.

Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.

Дорожная карта реализации

1

Определите целевые показатели задержки, качества и стоимости перед внедрением.

2

Тестирование при реалистичной нагрузке и условиях данных.

3

Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.

4

Перед масштабированием подготовьте пути отката и реагирования на инциденты.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DeepSpeed and Megatron Training Stacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Квантование после обучения GPTQ и AWQ

Часто задаваемые вопросы

What is DeepSpeed and Megatron Training Stacks?

DeepSpeed (Microsoft) и Megatron-LM (NVIDIA) — это программные стеки, которые делают реальными модели обучения с миллиардами параметров для тысяч графических процессоров. Без них современные передовые модели просто не смогли бы уместиться в памяти или завершить обучение в разумные сроки.

Какова основная цель оптимизатора ZeRO компании DeepSpeed?

ZeRO (Zero Redundancy Optimizer) устраняет избыточность памяти, распределяя состояния, градиенты и параметры оптимизатора по графическим процессорам, а не реплицируя их на каждом устройстве.

Как тензорный параллелизм, впервые реализованный в Megatron-LM, разделяет модель?

Тензорный параллелизм разделяет математические вычисления внутри одного слоя (например, при умножении большой матрицы) на несколько графических процессоров, что представляет собой внутриуровневое разделение.

Какой этап ZeRO обеспечивает наибольшую экономию памяти за счет сегментирования самих параметров модели?

ZeRO Stage 3 сегментирует параметры в дополнение к градиентам и состояниям оптимизатора, собирая их по требованию, обеспечивая максимальное сокращение памяти.

Что дает «контрольная точка активации» для экономии памяти во время обучения?

Контрольные точки активации сохраняют меньшее количество промежуточных активаций и пересчитывают их во время обратного распространения ошибки, заменяя дополнительные вычисления меньшим объемом памяти.

Почему объединение этих методов часто называют «3D-параллелизмом»?

3D-параллелизм объединяет три ортогональные стратегии: параллелизм данных, тензорный (внутриуровневый) параллелизм и конвейерный (межуровневый) параллелизм.