Awoṣe ati Pipeline Parallelism
Nigbati awoṣe ba tobi ju lati baamu lori GPU kan, awoṣe ati afiwera opo gigun ti epo pin awoṣe funrararẹ kọja awọn ẹrọ.
Akopọ
This is what makes training giant language models with hundreds of billions of parameters physically possible.
Jin Dive
Awọn ipin parallelism awoṣe awoṣe ẹyọkan kọja ọpọlọpọ awọn GPUs nitorinaa ko si ẹrọ kan ti o nilo lati di gbogbo awọn iwuwo mu. Awọn adun akọkọ meji wa. Tensor (intra-Layer) parallelism pin mathematiki inu Layer kan, gẹgẹbi gige isodipupo matrix nla kan kọja awọn GPU ti ọkọọkan ṣe iṣiro apakan ti iṣelọpọ. Pipeline (inter-Layer) parallelism sọtọ oriṣiriṣi awọn ipele itẹlera si oriṣiriṣi GPUs, nitorinaa dina Layer 1 ngbe lori GPU 0, dina 2 lori GPU 1, ati bẹbẹ lọ, pẹlu awọn iṣẹ ṣiṣe ti kọja siwaju bi laini apejọ kan. Ipenija pẹlu pipelining ailabawọn ni 'nkuta': lakoko ti GPU 0 n ṣiṣẹ lori ipele akọkọ, awọn GPU ti o wa ni isalẹ joko laišišẹ. Pipelining pin ipin kọọkan si awọn ipele micro-kiki gbogbo awọn ipele duro lọwọ, ni ilọsiwaju iṣamulo gaan.
Imọ-imọ-ẹrọ
Tensor parallelism (gẹgẹ bi ninu NVIDIA Megatron-LM) pin awọn matrices iwuwo iwe- tabi ọgbọn-ila ati lo gbogbo-din lati tun awọn abajade apa kan ṣe, titọju ibaraẹnisọrọ inu ipade NVLink ti o yara. Pipeline parallelism (GPipe, PipeDream) pin ipele naa si awọn ipele kekere ti o nṣan nipasẹ awọn ipele ni iṣeto isọkusọ, idinku akoko ‘bubble’ laišišẹ. Awọn mejeeji maa n ṣe siwa papọ, pẹlu isọra tensor laarin ipade kan ati pipeline parallelism kọja awọn apa.
Ipa Ilana
Iye owo ati isuna
Awọn ipinnu faaji ṣe awakọ iṣẹ ati idiyele iṣẹ fun awọn ọdun.
Awọn ipinnu diẹ sii
Ẹkọ imọ-ẹrọ ṣe iranlọwọ fun awọn ẹgbẹ lati yan akopọ to tọ, kii ṣe ọkan tuntun nikan.
Iṣakoso didara
Awọn yiyan imọ-ẹrọ to dara julọ dinku awọn iṣẹlẹ igbẹkẹle ni iṣelọpọ.
Ojo iwaju ti Awoṣe ati Pipeline Parallelism
Awọn ilana ṣiṣe adaṣe adaṣe iṣoro lile ti pinnu bi o ṣe le pin awoṣe kan kọja awọn ẹrọ, ni lilo profaili ati wiwa lati dọgbadọgba iṣiro ati ibaraẹnisọrọ. Reti isọpọ wiwọ ti tensor, opo gigun ti epo, ati afiwe data (parallelism 3D), ṣiṣe eto micro-ipele ijafafa lati fẹrẹ pa awọn nyoju opo gigun ti epo kuro, ati ohun elo pẹlu awọn asopọ iyara yiyara nitorina pipin ipele kan kọja awọn eerun di din owo ati ilana diẹ sii fun awọn awoṣe ti o tobi ju lailai.
Real-World imuse
Awọn awoṣe ara-ara GPT ikẹkọ pẹlu NVIDIA Megatron-LM, eyiti o pin akiyesi Layer transformer kọọkan ati awọn matiri ifunni siwaju kọja awọn GPU nipasẹ isọdọkan tensor.
Lilo GPipe lati gbe awọn ipele oriṣiriṣi ti iran nla kan tabi awoṣe ede sori awọn iyara iyara nigba ti micro-batching jẹ ki wọn ṣiṣẹ lọwọ.
Ẹnjini opo gigun ti DeepSpeed ti n pin awoṣe paramita pupọ-ọgọrun-biliọnu sinu awọn ipele kọja ọpọlọpọ awọn apa.
Apapọ parallelism tensor inu olupin 8-GPU ẹyọkan pẹlu afiwe opo gigun ti epo ti o tan awọn olupin lọpọlọpọ lati kọ awoṣe kan ti o tobi ju fun ẹrọ kan.
Awọn ewu & Awọn ọna iṣọ
Ṣiṣepe ala-ilẹ kan le tọju awọn ailagbara eto ti o gbooro.
Awọn ohun elo amayederun ati awọn idiyele itọju nigbagbogbo ni aibikita.
Aabo ati awọn ela akiyesi le dagba bi awọn eto ṣe di eka sii.
Ilana Ilana imuse
Ṣetumo lairi, didara, ati awọn ibi-afẹde idiyele ṣaaju imuse.
Aṣepari labẹ ẹru ojulowo ati awọn ipo data.
Abojuto ohun elo fun awọn aṣiṣe, fiseete, ati ipa olumulo.
Mura ipadasẹhin pada ati awọn ipa ọna esi iṣẹlẹ ṣaaju iwọn.
Tesiwaju Ṣiṣawari
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model and Pipeline Parallelism quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Itọsọna atẹle
Tensor Parallelism fun Awọn awoṣe nla
Awọn ibeere ti a beere nigbagbogbo
What is Model and Pipeline Parallelism?
Nigbati awoṣe ba tobi ju lati baamu lori GPU kan, awoṣe ati afiwera opo gigun ti epo pin awoṣe funrararẹ kọja awọn ẹrọ. Eyi ni ohun ti o jẹ ki awọn awoṣe ede nla ikẹkọ pẹlu awọn ọgọọgọrun ọkẹ àìmọye ti awọn ayeraye ṣee ṣe ni ti ara.
Iṣoro ipilẹ wo ni awoṣe ati afiwera opo gigun ti epo yanju?
Awoṣe ati opo gigun ti epo pin awoṣe funrararẹ kọja awọn ẹrọ, ṣiṣe ikẹkọ awọn nẹtiwọọki ti o tobi ju eyikeyi GPU kan le mu.
Bawo ni tensor (intra-Layer) parallelism pipin ṣiṣẹ?
Tensor parallelism pin iširo laarin kan nikan Layer, fun apẹẹrẹ yapa kan ti o tobi àdánù matrix ki kọọkan GPU iširo apakan ti awọn ti o wu jade.
Kini 'nkuta' ni afiwe opo gigun ti epo?
Ni kutukutu igbesẹ opo gigun ti epo, awọn ipele isalẹ ko ni titẹ sii sibẹsibẹ ati joko laišišẹ, jafara akoko GPU; àlàfo aláìṣiṣẹ́mọ́ yìí ni wọ́n ń pè ní èéfín.
Bawo ni parallelism opo gigun ti epo dinku nkuta?
Pipin ipele kan si awọn ipele kekere jẹ ki ọpọlọpọ awọn ipele micro-wa ni awọn ipele oriṣiriṣi ni igbakanna, mimu gbogbo awọn GPU ṣiṣẹ lọwọ ati idinku akoko aiṣiṣẹ.
Kini idi ti tensor parallelism ni igbagbogbo wa laarin ipade kan?
Tensor parallelism ibasọrọ nigbagbogbo lati tun awọn abajade matrix apa kan pọ, nitorinaa o gbe si ibiti bandiwidi interconnect ga julọ, inu ipade lori NVLink.