Nhungamiro yehunyanzvi

DeepSpeed ​​uye Megatron Kudzidzisa Stacks

DeepSpeed (Microsoft) neMegatron-LM (NVIDIA) ndiwo masisitimu esoftware anoita kuti mamodheru ekudzidzisa ane mabhiriyoni emaparamita muzviuru zveGPU zvigoneke.

2 min verengaLast update

Pfupiso

Without them, today's frontier models simply could not fit in memory or finish training in a reasonable time.

Kudzika Kwakadzika

Kudzidzisa modhi hombe pane imwe GPU hazvigoneke nekuti uremu, magiradhi, uye optimizer nyika hazvikwane. Aya masheki anopatsanura basa kune akawanda maGPU. Megatron-LM yakapayona tensor parallelism, kuchekerera matrix ega ega mukati mechikamu chimwe nechimwe paGPUs, pamwe nepombi parallelism, iyo inoisa akasiyana maGPU akasiyana. DeepSpeed's siginecha mupiro ndeye ZeRO (Zero Redundancy Optimizer), iyo shards optimizer nyika, gradients, uye maparamita mhiri kweGPUs panzvimbo yekuzvidzokorora, kucheka per-GPU ndangariro zvinoshamisa. Iwo maviri anowanzo kusanganiswa (Megatron-DeepSpeed ​​​​) kudzidzisa mhando seBLOOM-176B uye Megatron-Turing NLG. Ivo zvakare vanowedzera yakasanganiswa-chaiyo, activation yekutarisa, uye kurodha kuCPU kana NVMe saka mahombe mamodheru anodzidzisa pane mashoma hardware.

Technical Insight

ZeRO ine nhanho nhatu dzekuwedzera kuchengetedza ndangariro: Nhanho 1 shards optimizer inoti, Nhanho 2 zvakare shards gradients, uye Stage 3 shards iwo maparamita pachawo, achiaunganidza pakuda panguva yekumberi nekumashure. Zvakasanganiswa ne tensor parallelism (intra-layer) uye pipeline parallelism (inter-layer), izvi zvinoumba '3D parallelism.' Iko kunetsa kwakakosha kutaurirana pamusoro: yega yega shard kupatsanurwa inowedzera GPU-kune-GPU traffic, saka mainjiniya anorongedza kupatsanurwa kuchengetedza nekukurumidza NVLink uye InfiniBand zvinongedzo zvakazara.

Strategic Impact

Mutengo uye bhajeti

Zvisarudzo zvezvivakwa zvinotyaira kuita uye mutengo wekushandisa kwemakore.

Sarudzo dzakajeka

Dzidzo yehunyanzvi inobatsira zvikwata kusarudza murwi wakakodzera, kwete iwo mutsva chete.

Kudzora kwemhando yepamusoro

Sarudzo dzeinjiniya dziri nani dzinoderedza zviitiko zvekuvimbika mukugadzira.

Ramangwana reDeepSpeed uye Megatron Kudzidzisa Stacks

Tarisira kubatanidzwa kwakasimba nePyTorch's yekuzvarwa FSDP (Fully Sharded Data Parallel), iyo yakatora akawanda ZeRO mazano, kudzima mutsetse pakati petsvakiridzo stacks uye musimboti masisitimu. Compiler-driven approaches uye otomatiki parallelism kuronga vanovavarira kubvisa manyorero tuning. Sezvo masumbu ekudzidziswa achikura akananga kumazana ezviuru zveanokwidziridza, kushivirira kukanganisa, elastic scaling, uye kupindirana kutaurirana nemakomputa inova iyo inotungamira miganhu yeinjiniya, pamwe nerutsigiro rwehutsva hutsva seNVIDIA Blackwell uye tsika yekudzidzira machipisi.

Real-World Implementation

Kudzidzisa yakavhurika mitauro yakawanda BLOOM-176B modhi uchishandisa yakasanganiswa Megatron-DeepSpeed ​​stack mumazana emaGPU.

Microsoft neNVIDIA vachidzidzisa 530-bhiriyoni-parameter Megatron-Turing NLG modhi ine 3D parallelism.

ZeRO-Offload ichibvumira vaongorori kuti vagadzirise akawanda-mabhiriyoni-parameta modhi pane imwechete workstation GPU nekudurura optimizer nyika kuCPU RAM.

Kushandisa activation yekutarisa mune aya mastacks kuti ikwane kureba mamiriro windows nekudzokorodza ma activation pachinzvimbo chekuachengeta ese.

Njodzi & Guardrails

Kugadzirisa imwe bhenji kunogona kuvanza yakafara system kushaya simba.

Infrastructure uye mari yekugadzirisa inowanzotarisirwa pasi.

Chengetedzo uye kucherechedzwa mapundu anogona kukura sezvo masisitimu anowedzera kuoma.

Implementation Roadmap

1

Tsanangura latency, mhando, uye mutengo zvinangwa usati waitwa.

2

Benchmark pasi pechokwadi mutoro uye data mamiriro.

3

Chishandiso chekutarisa zvikanganiso, kudonha, uye mushandisi maitiro.

4

Gadzirira nzira dzekudzosera kumashure uye dzezviitiko usati wawedzera.

Ramba Uchiongorora

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DeepSpeed and Megatron Training Stacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Tanga mibvunzo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gaidhi rinotevera

GPTQ uye AWQ Post-Training Quantization

Mibvunzo inowanzo bvunzwa

What is DeepSpeed and Megatron Training Stacks?

DeepSpeed (Microsoft) neMegatron-LM (NVIDIA) ndiwo masisitimu esoftware anoita kuti mamodheru ekudzidzisa ane mabhiriyoni emaparamita muzviuru zveGPU zvigoneke. Pasina ivo, mamodheru emazuva ano haakwanise kukwana mundangariro kana kupedza kudzidziswa nenguva yakafanira.

Chii chinangwa chekutanga cheDeepSpeed's ZeRO optimizer?

ZeRO (Zero Redundancy Optimizer) inobvisa ndangariro kudzokororwa nekugovanisa optimizer nyika, gradients, uye maparamita mhiri kweGPUs pane kuzvidzokorora pane yega yega mudziyo.

Tensor parallelism, sekupayona muMegatron-LM, inotsemura modhi sei?

Tensor parallelism inopatsanura masvomhu mukati mechikamu chimwe chete (senge matrix hombe kuwanda) kuyambuka akawanda maGPU, iri intra-layer kupatsanura.

Ndeipi ZeRO nhanho inopa yakanyanya ndangariro kuchengetedza nekugovanisa modhi paramita pachayo?

ZeRO Stage 3 shards paramita mukuwedzera kune gradients uye optimizer nyika, kuzviunganidza pazvinodikanwa, zvichipa yakanyanya kuderedzwa ndangariro.

Chii chinonzi 'activation cheki' chinotengeserana kure kuchengetedza ndangariro panguva yekudzidziswa?

Activation yekutarisa inochengetedza mashoma epakati activation uye anoadzokorora panguva yekudzokera shure, kutengesa yakawedzera computation yekuderedzwa ndangariro.

Sei kusanganisa matekiniki aya kuchiwanzonzi '3D parallelism'?

3D parallelism inorongedza matatu orthogonal nzira: data parallelism, tensor (intra-layer) parallelism, uye pipeline (inter-layer) parallelism.