Тензорен паралелизъм за големи модели
Начин за разделяне на математиката вътре в един слой невронна мрежа между множество графични процесори, така че модел, който е твърде голям за едно устройство, все още да може да работи.
Преглед
It matters because frontier models have hundreds of billions of parameters that no single GPU can hold or compute fast enough alone.
Дълбоко гмуркане
Тензорният паралелизъм (наричан още паралелизъм на вътрешнослойния модел) разделя индивидуалните тегловни матрици в GPU, вместо да поставя цели слоеве на отделни устройства. В трансформатор, големите матрични умножения – проекциите на вниманието и MLP с подаване напред – са разделени: например първата матрица на теглото на MLP е разделена на колони, а втората на редове, така че всеки графичен процесор изчислява секция и едно цялостно намаляване комбинира резултатите. Вниманието е разделено между главите, като всеки GPU обработва подмножество. Тъй като всеки GPU изпълнява част от всеки слой едновременно, тензорният паралелизъм намалява паметта на GPU и ускорява изчисленията, но изисква честа комуникация с висока честотна лента между GPU на всеки слой. Ето защо обикновено се ограничава в рамките на възел, свързан с NVLink, и се комбинира с конвейер и паралелизъм на данни за много големи задачи за обучение и обслужване.
Техническа информация
Номерът, популяризиран от Megatron-LM, е изборът на размери на дяла, така че комуникацията да е минимална. Разделянето на първата MLP матрица по колони позволява на всеки GPU да прилага нелинейността локално без синхронизация; разделянето на втория ред означава, че изходите просто се нуждаят от едно цялостно намаляване, за да сумират частични резултати. По този начин всеки слой включва приблизително две всички редукции (напред) и две (назад). Тъй като тези колективи се случват на всеки слой, латентността доминира - така че тензорният паралелизъм живее зад бързи вътрешновъзлови връзки като NVLink, а не по-бавни междувъзлови мрежи.
Стратегическо въздействие
Cost and budget
Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.
Clearer decisions
Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.
Quality control
По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.
Бъдещето на тензорния паралелизъм за големи модели
Тензорният паралелизъм остава основополагащ, но все повече се смесва с „3D паралелизъм“ (тензор + тръбопровод + данни) и се комбинира с експертен паралелизъм за смесени модели на експерти. Рамки като Megatron-LM, DeepSpeed и vLLM автоматизират шардинга. Тъй като връзките на GPU (NVLink, NVSwitch) и оптичните тъкани стават по-бързи, ограничението на границата на възела се отпуска, позволявайки по-широки тензорно-паралелни групи. Очаквайте по-интелигентно автоматично паралелизиране, което избира размери на сегменти и размери на групи, за да минимизира комуникацията за дадена клъстерна топология.
Внедряване в реалния свят
Обучение на модел със 175B параметър чрез разделяне на тегловните матрици на всеки слой в 8 GPU в един свързан с NVLink възел с помощта на Megatron-LM.
Обслужване на 70B-параметър чат модел във vLLM с tensor_parallel_size=4, така че теглата да пасват на четири GPU и да отговарят в реално време.
Разделянето на вниманието на трансформатора се насочва към GPU, така че всяко устройство изчислява подмножество, след което обединява изходите за следващия слой.
Комбиниране на тензорен паралелизъм в рамките на възли и паралелизъм на тръбопроводи между възли за обучение на модели с трилиони параметри на големи GPU клъстери.
Рискове и предпазни огради
Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.
Разходите за инфраструктура и поддръжка често се подценяват.
Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.
Пътна карта за изпълнение
Определете целите за латентност, качество и разходи преди внедряването.
Бенчмарк при реалистични условия на натоварване и данни.
Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.
Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tensor Parallelism for Large Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Паралелизъм на модел и конвейер
Frequently asked questions
What is Tensor Parallelism for Large Models?
Начин за разделяне на математиката вътре в един слой невронна мрежа между множество графични процесори, така че модел, който е твърде голям за едно устройство, все още да може да работи. Има значение, защото граничните модели имат стотици милиарди параметри, които нито един GPU не може да поддържа или да изчисли достатъчно бързо сам.
Какво разделя тензорният паралелизъм между GPU?
Тензорният (вътрешнослоев) паралелизъм разделя тегловните матрици вътре в слой, така че всеки графичен процесор изчислява част от един и същи слой – различен от конвейерния паралелизъм, който поставя цели слоеве на различни графични процесори.
При разделянето на MLP в стил Megatron, как са разделени двете матрици на теглото, за да се сведе до минимум комуникацията?
Разделянето на първата матрица по колони позволява на всеки графичен процесор да прилага локално нелинейността; разделянето на втория по редове означава, че едно цялостно намаляване сумира частичните изходи - минимизиране на синхронизацията.
Защо тензорният паралелизъм обикновено се поддържа в рамките на един възел?
Всеки слой задейства колективна комуникация (all-reduces), така че тежкият, чувствителен към латентност трафик изисква бързи връзки между възли като NVLink, а не по-бавни мрежи между възли.
Как механизмът на вниманието обикновено се паралелизира при тензорен паралелизъм?
Главите на вниманието са независими, така че са разпределени между графичните процесори - всяко устройство изчислява някои глави и изходите се комбинират.
Коя колективна операция обикновено комбинира частични резултати в тензорния паралелизъм?
All-reduce сумира частичните изходи, изчислени на всеки графичен процесор, така че те са съгласни с резултата на слоя; това се случва няколко пъти на слой при преминаване напред и назад.