DeepSpeed ati awọn akopọ Ikẹkọ Megatron
DeepSpeed (Microsoft) ati Megatron-LM (NVIDIA) jẹ awọn akopọ sọfitiwia ti o jẹ ki awọn awoṣe ikẹkọ pẹlu awọn ọkẹ àìmọye awọn ayeraye kọja ẹgbẹẹgbẹrun GPUs nitootọ ṣee ṣe.
Akopọ
Laisi wọn, awọn awoṣe aala ti ode oni ko le baamu ni iranti tabi pari ikẹkọ ni akoko ti o tọ.
Jin Dive
Ikẹkọ awoṣe nla lori GPU kan ko ṣee ṣe nitori awọn iwuwo, gradients, ati awọn ipinlẹ iṣapeye ko baamu. Awọn akopọ wọnyi pin iṣẹ naa kọja ọpọlọpọ awọn GPUs. Megatron-LM ṣe aṣaaju-ọna tensor parallelism, gige awọn isodipupo matrix kọọkan inu Layer kọọkan kọja awọn GPUs, pẹlu afiwe opo gigun ti epo, eyiti o fi awọn ipele oriṣiriṣi sori oriṣiriṣi GPUs. Ifọwọsi Ibuwọlu DeepSpeed jẹ ZeRO (Zero Redundancy Optimizer), eyiti awọn ipinlẹ iṣapeye, awọn gradients, ati awọn ayeraye kọja awọn GPU dipo ṣiṣe ẹda wọn, gige fun iranti GPU kọọkan ni iyalẹnu. Awọn mejeeji nigbagbogbo ni idapo (Megatron-DeepSpeed) lati kọ awọn awoṣe bii BLOOM-176B ati Megatron-Turing NLG. Wọn tun ṣafikun deede-konge, ṣiṣayẹwo imuṣiṣẹ, ati gbigbe si Sipiyu tabi NVMe nitorina awọn awoṣe nla ṣe ikẹkọ lori ohun elo to lopin.
Imọ-imọ-ẹrọ
ZeRO ni awọn ipele mẹta ti jijẹ awọn ifowopamọ iranti: Ipele 1 awọn ipinlẹ iṣapeye shards, Ipele 2 tun awọn gradients shards, ati Ipele 3 shards awọn aye ara wọn, apejọ wọn lori ibeere lakoko awọn gbigbe siwaju ati sẹhin. Ni idapo pelu tensor parallelism (intra-Layer) ati pipeline parallelism (inter-Layer), eyi jẹ 'parallelism 3D.' Ẹdọfu bọtini jẹ ibaraẹnisọrọ lori oke: gbogbo pipin shard ṣe afikun ijabọ-GPU-si-GPU, nitorinaa awọn onimọ-ẹrọ tune pipin naa lati jẹ ki awọn ọna asopọ NVLink ati InfiniBand yara ni kikun.
Ipa Ilana
Iye owo ati isuna
Awọn ipinnu faaji ṣe awakọ iṣẹ ati idiyele iṣẹ fun awọn ọdun.
Awọn ipinnu diẹ sii
Ẹkọ imọ-ẹrọ ṣe iranlọwọ fun awọn ẹgbẹ lati yan akopọ to tọ, kii ṣe ọkan tuntun nikan.
Iṣakoso didara
Awọn yiyan imọ-ẹrọ to dara julọ dinku awọn iṣẹlẹ igbẹkẹle ni iṣelọpọ.
Ọjọ iwaju ti DeepSpeed ati Awọn akopọ Ikẹkọ Megatron
Reti isọdọkan wiwọ pẹlu abinibi PyTorch's FSDP (Parallel Data Sharded ni kikun), eyiti o fa ọpọlọpọ awọn imọran ZeRO mu, titọ laini laarin awọn akopọ iwadii ati awọn ilana ipilẹ. Awọn isunmọ iṣakojọpọ ati awọn oluṣeto parallelism adaṣe ni ifọkansi lati yọ yiyi afọwọṣe kuro. Bii awọn iṣupọ ikẹkọ ti n dagba si awọn ọgọọgọrun egbegberun awọn iyara, ifarada ẹbi, wiwọn rirọ, ati ibaraẹnisọrọ agbekọja pẹlu iṣiro di awọn aala imọ-ẹrọ ti o ga julọ, lẹgbẹẹ atilẹyin fun ohun elo tuntun bii NVIDIA Blackwell ati awọn eerun ikẹkọ aṣa.
Real-World imuse
Ikẹkọ awoṣe BLOOM-176B multilingual ti ṣiṣi ni lilo akopọ Megatron-DeepSpeed ni idapo kọja awọn ọgọọgọrun ti GPUs.
Microsoft ati NVIDIA ikẹkọ 530-bilionu-parameter Megatron-Turing NLG awoṣe pẹlu 3D parallelism.
ZeRO-Offload jẹ ki awọn oniwadi ṣe itanran-tune awọn awoṣe paramita pupọ-bilionu-pupọ lori GPU iṣẹ kan ṣoṣo nipa sisọ awọn ipinlẹ iṣapeye si Ramu Sipiyu.
Lilo iṣayẹwo imuṣiṣẹ ni awọn akopọ wọnyi lati baamu awọn ferese ọrọ to gun gigun nipa ṣiṣe atunṣiro awọn iṣẹ ṣiṣe dipo fifi gbogbo wọn pamọ.
Awọn ewu & Awọn ọna iṣọ
Ṣiṣepe ala-ilẹ kan le tọju awọn ailagbara eto ti o gbooro.
Awọn ohun elo amayederun ati awọn idiyele itọju nigbagbogbo ni aibikita.
Aabo ati awọn ela akiyesi le dagba bi awọn eto ṣe di eka sii.
Ilana Ilana imuse
Ṣetumo lairi, didara, ati awọn ibi-afẹde idiyele ṣaaju imuse.
Aṣepari labẹ ẹru ojulowo ati awọn ipo data.
Abojuto ohun elo fun awọn aṣiṣe, fiseete, ati ipa olumulo.
Mura ipadasẹhin pada ati awọn ipa ọna esi iṣẹlẹ ṣaaju iwọn.
Tesiwaju Ṣiṣawari
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DeepSpeed and Megatron Training Stacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Itọsọna atẹle
GPTQ ati AWQ Post-Training Quantization
Awọn ibeere ti a beere nigbagbogbo
Kini DeepSpeed ati Awọn akopọ Ikẹkọ Megatron?
DeepSpeed (Microsoft) ati Megatron-LM (NVIDIA) jẹ awọn akopọ sọfitiwia ti o jẹ ki awọn awoṣe ikẹkọ pẹlu awọn ọkẹ àìmọye awọn ayeraye kọja ẹgbẹẹgbẹrun GPUs nitootọ ṣee ṣe. Laisi wọn, awọn awoṣe aala ode oni ko le baamu ni iranti tabi pari ikẹkọ ni akoko oye.
Kini idi akọkọ ti DeepSpeed's ZeRO optimizer?
ZeRO (Zero Redundancy Optimizer) imukuro iranti apọju nipa pipin awọn ipinlẹ iṣapeye, awọn gradients, ati awọn ayeraye kọja awọn GPU dipo kikojọ wọn lori ẹrọ kọọkan.
Tensor parallelism, bi aṣáájú-ọnà ni Megatron-LM, pin awoṣe bi?
Tensor parallelism awọn ipin mathimatiki inu Layer kan (gẹgẹbi isodipupo matrix nla) kọja awọn GPU lọpọlọpọ, eyiti o jẹ pipin inu-Layer.
Ipele ZeRO wo ni o pese awọn ifowopamọ iranti ti o tobi julọ nipa tun pin awọn paramita awoṣe funrararẹ?
Awọn ipele shards Ipele 3 ZeRO ni afikun si awọn gradients ati awọn ipinlẹ iṣapeye, apejọ wọn lori ibeere, fifun idinku iranti ti o tobi julọ.
Kini 'iṣayẹwo imuṣiṣẹ' ṣe iṣowo kuro lati fi iranti pamọ lakoko ikẹkọ?
Ṣiṣayẹwo imuṣiṣẹ n tọju awọn iṣiṣẹ agbedemeji diẹ ati ṣe iṣiro wọn lakoko isọdọtun, iṣowo iṣiro afikun fun iranti idinku.
Kini idi ti apapọ awọn ilana wọnyi nigbagbogbo n pe ni 'parallelism 3D'?
3D parallelism akopọ meta orthogonal ogbon: data parallelism, tensor (intra-Layer) parallelism, ati opo gigun (inter-Layer) parallelism.