UMHLAHLANDLELA Wobuchwepheshe

I-DeepSpeed ​​kanye ne-Megatron Training Stacks

I-DeepSpeed (Microsoft) kanye ne-Megatron-LM (NVIDIA) izitaki zesofthiwe ezenza amamodeli okuqeqesha anezigidigidi zamapharamitha ezinkulungwaneni zama-GPU abe nokwenzeka ngempela.

2 amaminithi ukufundaIgcine ukubuyekezwa

Uhlolojikelele

Without them, today's frontier models simply could not fit in memory or finish training in a reasonable time.

I-Deep Dive

Ukuqeqesha imodeli enkulu ku-GPU eyodwa akwenzeki ngoba izisindo, ama-gradient, nezimo ze-optimizer azilingani. Lezi zitaki zihlukanisa umsebenzi kuma-GPU amaningi. I-Megatron-LM iphayona i-tensor parallelism, isika ukuphindaphindeka kwe-matrix ngayinye ngaphakathi kwesendlalelo ngasinye kuma-GPU, kanye nokuhambisana kwamapayipi, okubeka izendlalelo ezihlukene kuma-GPU ahlukene. Umnikelo wesignesha we-DeepSpeed ​​yi-ZeRO (Zero Redundancy Optimizer), ethuthukisa izifundazwe, ama-gradients, namapharamitha kuwo wonke ama-GPU esikhundleni sokuwaphindaphinda, ukusika inkumbulo ye-GPU ngayinye ngendlela emangazayo. Okubili kuvame ukuhlanganiswa (Megatron-DeepSpeed) ukuqeqesha amamodeli afana ne-BLOOM-176B ne-Megatron-Turing NLG. Baphinde bangeze ukunemba okuxubile, ukuhlola okuvulayo, nokulayishwa ku-CPU noma ku-NVMe ukuze amamodeli amakhulu aqeqeshe ngehadiwe elinganiselwe.

I-Technical Insight

I-ZeRO inezigaba ezintathu zokwandisa ukonga inkumbulo: Isigaba 1 se-shards optimizer states, Isiteji sesi-2 siphinde sishicilele ama-gradients, futhi Isiteji sesi-3 siphuca amapharamitha ngokwawo, ukuwaqoqa ngokufunwa ngesikhathi sokudlula okuya phambili nangemuva. Kuhlanganiswe ne-tensor parallelism (intra-layer) kanye nephayiphi parallelism (inter-layer), lokhu kwakha 'i-3D parallelism.' Ukushuba okubalulekile ukuxhumana okungaphezulu: konke ukuhlukaniswa kwe-shard kungeza ithrafikhi ye-GPU-to-GPU, ngakho onjiniyela bashuna ukuhlukana ukuze bagcine izixhumanisi ze-NVLink ne-InfiniBand zigcwele.

I-Strategic Impact

Izindleko kanye nesabelomali

Izinqumo zezakhiwo ziqhuba ukusebenza kanye nezindleko zokusebenza iminyaka.

Izinqumo ezicacile

Imfundo yobuchwepheshe isiza amaqembu ukuthi akhethe isitaki esifanele, hhayi nje esisha.

Ukulawulwa kwekhwalithi

Izinketho ezingcono zobunjiniyela zinciphisa izehlakalo ezinokwethenjelwa ekukhiqizeni.

Ikusasa Le-DeepSpeed kanye Nezitaki Zokuqeqesha ze-Megatron

Lindela ukuhlanganiswa okuqinile ne-FSDP yomdabu yakwa-PyTorch (Fully Sharded Data Parallel), ebambe imibono eminingi ye-ZeRO, ifiphaze umugqa phakathi kwezitaki zocwaningo nezinhlaka eziyinhloko. Izindlela eziqhutshwa yi-compiler kanye nabahleli be-parallelism abazenzakalelayo bahlose ukususa ukushuna mathupha. Njengoba amaqoqo okuqeqesha ekhula afinyelela kumakhulu ezinkulungwane zamasheshisi, ukubekezelela amaphutha, ukukala okunwebekayo, nokuxhumana okugqagqene ngekhompyutha kuba imingcele yobunjiniyela ehamba phambili, ngokuhambisana nokusekelwa kwezingxenyekazi zekhompyutha ezintsha njenge-NVIDIA Blackwell nama-chips okuqeqesha ngokwezifiso.

Ukuqaliswa Komhlaba Wangempela

Ukuqeqesha imodeli yezilimi eziningi evulekile ye-BLOOM-176B kusetshenziswa isitaki se-Megatron-DeepSpeed ​​​​esihlanganisiwe kumakhulukhulu ama-GPU.

Microsoft kanye ne-NVIDIA iqeqesha imodeli ye-530-billion-parameter Megatron-Turing NLG nge-3D parallelism.

I-ZeRO-Offload ivumela abacwaningi ukuthi bashune kahle amamodeli epharamitha ezigidigidi ku-GPU yendawo yokusebenza eyodwa ngokuchitha izimo ze-optimizer ku-CPU RAM.

Kusetshenziswa ukuhlola kokuvula kulezi zitaki ukuze kulingane amawindi womongo amade ngokubala kabusha ukwenza kusebenze esikhundleni sokukugcina konke.

Izingozi & Guardrails

Ukuthuthukisa ibhentshimakhi eyodwa kungafihla ubuthakathaka obubanzi besistimu.

Izindleko zengqalasizinda nezokulungisa zivame ukubukelwa phansi.

Izikhala zokuphepha nokubonakala zingakhula njengoba izinhlelo ziba nzima kakhulu.

Ukuqalisa Umhlahlandlela

1

Chaza ukubambezeleka, ikhwalithi, nezindleko ezihlosiwe ngaphambi kokuqaliswa.

2

Ibhentshimakhi ngaphansi komthwalo wangempela nezimo zedatha.

3

Ukuqapha amathuluzi amaphutha, ukukhukhuleka, nomthelela wabasebenzisi.

4

Lungiselela izindlela zokuhlehlisa nezigameko ngaphambi kokukala.

Qhubeka Uhlole

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DeepSpeed and Megatron Training Stacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Qala imibuzo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Umhlahlandlela olandelayo

I-GPTQ kanye ne-AWQ Post-Training Quantization

Imibuzo evame ukubuzwa

What is DeepSpeed and Megatron Training Stacks?

I-DeepSpeed (Microsoft) kanye ne-Megatron-LM (NVIDIA) izitaki zesofthiwe ezenza amamodeli okuqeqesha anezigidigidi zamapharamitha ezinkulungwaneni zama-GPU abe nokwenzeka ngempela. Ngaphandle kwazo, amamodeli wanamuhla awakwazanga ukungena enkumbulweni noma aqedele ukuqeqeshwa ngesikhathi esifanele.

Iyini inhloso yokuqala ye-DeepSpeed's ZeRO optimizer?

I-ZeRO (Zero Redundancy Optimizer) iqeda ukuphindaphindeka kwenkumbulo ngokuhlukanisa izifunda, ama-gradient, namapharamitha kuwo wonke ama-GPU kunokuwaphindaphinda kudivayisi ngayinye.

I-tensor parallelism, njengoba iphayona ku-Megatron-LM, ihlukanisa kanjani imodeli?

I-tensor parallelism ihlukanisa izibalo ngaphakathi kwesendlalelo esisodwa (okufana nokuphindaphinda kwe-matrix enkulu) kuma-GPU amaningi, okuhlukanisa ngaphakathi kwesendlalelo.

Isiphi isigaba se-ZeRO esinikeza ukonga okukhulu kwenkumbulo ngokuhlukanisa amapharamitha wona ngokwawo?

Amapharamitha we-ZeRO Stage 3 shards ngaphezu kwama-gradients kanye nezifunda ze-optimizer, ukuwaqoqa ngokufunwa, okunikeza ukuncishiswa kwenkumbulo okukhulu kakhulu.

Ingabe 'i-activation checkpointing' ihweba kanjani ukuze ulondoloze inkumbulo ngesikhathi sokuqeqeshwa?

Ukuhlola okwenziwa kusebenze kugcina okwenziwa kusebenze okumbalwa okumaphakathi futhi kuphinde kubalwe kabusha ngesikhathi sokusakazwa kwe-backpropagation, ihweba ukubala okwengeziwe kwenkumbulo encishisiwe.

Kungani ukuhlanganisa lezi zindlela ngokuvamile kubizwa ngokuthi 'i-3D parallelism'?

I-3D parallelism inqwabelanisa amasu amathathu e-orthogonal: i-data parallelism, i-tensor (intra-layer) parallelism, kanye ne-pipeline (inter-layer) parallelism.