MWONGOZO wa Kiufundi

Usambamba wa Tensor kwa Modeli Kubwa

Njia ya kugawanya hesabu ndani ya safu moja ya neural-network kwenye GPU nyingi ili muundo mkubwa sana kwa kifaa kimoja bado uweze kufanya kazi.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It matters because frontier models have hundreds of billions of parameters that no single GPU can hold or compute fast enough alone.

Dive ya kina

Usambamba wa kidhibiti (pia huitwa usawa wa muundo wa safu ya ndani) hupasua matiti ya uzani wa mtu binafsi kwenye GPU badala ya kuweka tabaka zima kwenye vifaa tofauti. Katika kibadilishaji kibadilishaji, matriki makubwa ya kuzidisha—makadirio ya uangalifu na MLP ya kulisha-mbele—hugawanywa: kwa mfano, matrix ya kwanza ya uzani wa MLP hugawanywa kwa safu wima na ya pili kwa safu mlalo, kwa hivyo kila GPU inakokotoa kipande na kupunguza moja kwa moja huchanganya matokeo. Uangalifu umegawanywa katika vichwa, na kila GPU inashughulikia kitengo kidogo. Kwa sababu kila GPU hufanya sehemu ya kila safu kwa wakati mmoja, usawa wa tensor hupunguza kumbukumbu kwa kila GPU na kuongeza kasi ya kukokotoa, lakini inahitaji mawasiliano ya mara kwa mara, ya juu-bandwidth kati ya GPU kila safu. Ndio maana kawaida hufungiwa ndani ya nodi iliyounganishwa na NVLink, na kuunganishwa na bomba na usawa wa data kwa mafunzo makubwa sana na kazi za kuhudumia.

Ufahamu wa Kiufundi

Ujanja, unaojulikana na Megatron-LM, ni kuchagua vipimo vya kizigeu ili mawasiliano yawe kidogo. Kugawanya safu wima ya kwanza ya MLP kulingana na safu wima huruhusu kila GPU kutumia kutokuwa na mstari ndani ya nchi bila usawazishaji; kugawanya safu ya pili-busara inamaanisha matokeo yanahitaji tu kupunguza moja ili kujumlisha matokeo ya sehemu. Kwa hivyo, kila safu huleta takriban njia mbili za kupunguzwa (mbele) na mbili (nyuma). Kwa sababu mikusanyiko hii hutokea kila safu, muda wa kusubiri unatawala-kwa hivyo usawa wa tensor huishi nyuma ya viungo vya haraka vya ndani kama NVLink badala ya mitandao ya polepole kati ya nodi.

Athari za kimkakati

Cost and budget

Maamuzi ya usanifu huendesha utendaji na gharama ya uendeshaji kwa miaka.

Maamuzi ya wazi zaidi

Elimu ya kiufundi husaidia timu kuchagua safu sahihi, sio tu mpya zaidi.

Quality control

Chaguo bora za uhandisi hupunguza matukio ya kuaminika katika uzalishaji.

Mustakabali wa Usambamba wa Tensor kwa Modeli Kubwa

Usambamba wa tensor unasalia kuwa msingi lakini unazidi kuchanganywa katika 'usambamba wa 3D' (tensor + bomba + data) na kuunganishwa na usambamba wa kitaalamu kwa miundo ya Mchanganyiko-wa-Wataalamu. Mifumo kama vile Megatron-LM, DeepSpeed, na vLLM hubadilisha uwekaji kiotomatiki. Kadiri GPU inavyounganishwa (NVLink, NVSwitch) na vitambaa vya macho vinapokua haraka, kikomo cha mpaka wa nodi hulegea, na kuruhusu vikundi vipana vya usawa wa tensor. Tarajia ulinganishaji nadhifu wa kiotomatiki ambao huchagua vipimo vya shard na ukubwa wa kikundi ili kupunguza mawasiliano kwa topolojia ya nguzo fulani.

Utekelezaji wa Ulimwengu Halisi

Kufunza muundo wa kigezo cha 175B kwa kugawanya vipimo vya uzito vya kila safu kwenye GPU 8 katika nodi moja iliyounganishwa na NVLink kwa kutumia Megatron-LM.

Inatumikia muundo wa gumzo wa vigezo 70B katika vLLM na tensor_parallel_size=4 ili uzani utoshee kwenye GPU nne na ujibu kwa wakati halisi.

Kugawanya vichwa vya umakini wa kibadilishaji kwenye GPU ili kila kifaa kikokote kitengo kidogo, kisha kuunganisha matokeo ya safu inayofuata.

Kuchanganya usawa wa tensor ndani ya nodi na usambamba wa bomba kwenye nodi ili kutoa mafunzo kwa miundo ya trilioni ya vigezo kwenye makundi makubwa ya GPU.

Hatari & Walinzi

Kuboresha kiwango kimoja kunaweza kuficha udhaifu mkubwa wa mfumo.

Gharama za miundombinu na matengenezo mara nyingi hupunguzwa.

Mapengo ya usalama na uonekanaji yanaweza kukua kadiri mifumo inavyozidi kuwa ngumu.

Ramani ya Utekelezaji

1

Bainisha muda, ubora na malengo ya gharama kabla ya utekelezaji.

2

Benchmark chini ya mzigo halisi na hali ya data.

3

Ufuatiliaji wa ala kwa makosa, kuteleza, na athari za mtumiaji.

4

Tayarisha njia za urejeshaji na majibu ya matukio kabla ya kuongeza ukubwa.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tensor Parallelism for Large Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Usambamba wa Mfano na Bomba

Maswali yanayoulizwa mara kwa mara

What is Tensor Parallelism for Large Models?

Njia ya kugawanya hesabu ndani ya safu moja ya neural-network kwenye GPU nyingi ili muundo mkubwa sana kwa kifaa kimoja bado uweze kufanya kazi. Ni muhimu kwa sababu miundo ya mipakani ina mamia ya mabilioni ya vigezo ambavyo hakuna GPU moja inayoweza kushikilia au kukokotoa kwa haraka vya kutosha pekee.

Usambamba wa tensor unagawanyika nini kwenye GPU?

Usambamba wa kipimio (safu ya ndani) hugawanya matiti ya uzani ndani ya safu, kwa hivyo kila GPU inakokotoa sehemu ya safu sawa—tofauti na ulinganifu wa bomba, ambayo huweka tabaka zima kwenye GPU tofauti.

Katika mgawanyiko wa MLP wa mtindo wa Megatron, matiti mawili ya uzani hugawanywaje ili kupunguza mawasiliano?

Kugawanya matrix ya kwanza kwa safu wima huruhusu kila GPU kutumia kutokuwa na mstari ndani ya nchi; kugawanya ya pili kwa safu mlalo inamaanisha kupunguza moja kwa moja jumla ya matokeo ya sehemu-kupunguza usawazishaji.

Kwa nini usawa wa tensor kawaida huwekwa ndani ya nodi moja?

Kila safu huanzisha mawasiliano ya pamoja (hupunguza yote), kwa hivyo msongamano mzito, unaonyeti muda wa kusubiri hudai viungo vya haraka vya nodi za ndani kama NVLink badala ya mitandao ya polepole kati ya nodi.

Je, utaratibu wa uangalizi kawaida husawazishwa vipi chini ya usawa wa tensor?

Vichwa vya kuzingatia havijitegemea, kwa hivyo vinasambazwa kote kwenye GPUs-kila kifaa hujumuisha baadhi ya vichwa na matokeo yanaunganishwa.

Ni operesheni gani ya pamoja ambayo kawaida huchanganya matokeo ya sehemu katika usawa wa tensor?

Punguzo lote linajumlisha matokeo ya sehemu yaliyokokotwa kwenye kila GPU ili yakubaliane na matokeo ya safu; hii hutokea mara nyingi kwa kila safu katika kupita mbele na nyuma.