Ni kikun Sharded Data Parallel
Parallel Data Sharded ni kikun (FSDP) jẹ ilana ikẹkọ pinpin ti o pin awọn ayewọn awoṣe, awọn gradients, ati awọn ipinlẹ iṣapeye kọja ọpọlọpọ awọn GPUs nitorinaa ẹrọ kọọkan mu bibẹ pẹlẹbẹ kan nikan.
Akopọ
It makes training huge models possible on hardware that could never fit the whole model in one GPU's memory.
Jin Dive
Ibaṣepọ data ti aṣa ntọju ẹda kikun ti awoṣe lori gbogbo GPU, eyiti o padanu iranti ati iwọn awoṣe awọn fila. FSDP, gbajugbaja nipasẹ Meta's PyTorch ati atilẹyin nipasẹ Microsoft's ZeRO, dipo awọn nkan mẹta kọja awọn ẹrọ: paramita, gradients, ati awọn ipinlẹ imudara. Lakoko irekọja siwaju, GPU kọọkan n ṣajọ awọn iwọn ni kikun fun ipele ti o n ṣe iṣiro nipasẹ apejọ gbogbo, ṣiṣe iṣiro naa, lẹhinna lẹsẹkẹsẹ da ẹda ti o pejọ silẹ. Ikọja sẹhin n ṣiṣẹ bakanna, atẹle nipasẹ idinku-tuka ti o pin kaakiri awọn ege gradient pada si awọn GPU ti wọn ni. Nitori ẹrọ kọọkan nikan ni o tọju ida kan ti awoṣe patapata, lilo iranti ṣubu ni aijọju laini pẹlu nọmba awọn GPU, jẹ ki awọn ẹgbẹ ṣe ikẹkọ awọn awoṣe pẹlu awọn mewa tabi awọn ọgọọgọrun ọkẹ àìmọye awọn aye.
Imọ-imọ-ẹrọ
FSDP ṣe iṣowo ibaraẹnisọrọ ni afikun fun awọn ifowopamọ iranti. Awọn iwuwo Layer kọọkan ni a tun ṣe lori ibeere pẹlu gbogbo-kojọpọ ṣaaju lilo ati asonu lẹsẹkẹsẹ lẹhin, lakoko ti awọn gradients ti wa ni idapo ati pin pẹlu idinku-tuka. Ibaraẹnisọrọ le ti wa ni overlapped pẹlu isiro nipa prefetching nigbamii ti Layer ká sile nigba ti isiyi Layer nṣiṣẹ, nọmbafoonu Elo ti awọn lairi nẹtiwọki. Yiyi granularity sharding (eto imulo ipari) ṣe iwọntunwọnsi ifẹsẹtẹ iranti lodi si oke ibaraẹnisọrọ.
Ipa Ilana
Iye owo ati isuna
Awọn ipinnu faaji ṣe awakọ iṣẹ ati idiyele iṣẹ fun awọn ọdun.
Awọn ipinnu diẹ sii
Ẹkọ imọ-ẹrọ ṣe iranlọwọ fun awọn ẹgbẹ lati yan akopọ to tọ, kii ṣe ọkan tuntun nikan.
Iṣakoso didara
Awọn yiyan imọ-ẹrọ to dara julọ dinku awọn iṣẹlẹ igbẹkẹle ni iṣelọpọ.
Ojo iwaju ti Ni kikun Sharded Data Parallel
FSDP n di aiyipada fun ikẹkọ awoṣe nla ti ṣiṣi, pẹlu FSDP2 ni PyTorch imudarasi lilo ati sharding paramita kọọkan. Reti isọdọkan wiwọ pẹlu tensor ati afiwe opo gigun ti epo fun awọn awoṣe paramita aimọye, atilẹyin to dara julọ fun konge adapọ ati fp8, ati murasilẹ adaṣe adaṣe ijafafa ti o yan awọn aala sharding fun ọ. Bi inter-GPU interconnects bi NVLink ati InfiniBand gba yiyara, awọn ibaraẹnisọrọ iye owo ti sharding ntọju isunki, ṣiṣe awọn ti o wulo ni lailai-tobi irẹjẹ.
Real-World imuse
Ṣiṣatunṣe didara awoṣe Llama 70-bilionu-paramita kọja awọn GPUs 8 ti ọkọọkan ko le di awọn iwuwo ni kikun mu.
Ṣiṣe ikẹkọ awọn awoṣe ede nla ni awọn ile-iṣọ AI nipasẹ pinpin awọn ipinlẹ iṣapeye (eyiti o jẹ gaba lori iranti pẹlu Adam) kọja awọn ọgọọgọrun ti awọn iyara.
Awọn oniwadi lilo PyTorch's FSDP wrapper lati ṣe ikẹkọ awọn oluyipada iran lori iṣupọ ile-ẹkọ giga kan laisi rira awọn flagship 80GB GPUs.
Apapọ FSDP pẹlu adalu-konge bfloat16 si aijọju idaji iranti ati titẹ soke ikẹkọ lori awọn awoṣe multimodal.
Awọn ewu & Awọn ọna iṣọ
Ṣiṣepe ala-ilẹ kan le tọju awọn ailagbara eto ti o gbooro.
Awọn ohun elo amayederun ati awọn idiyele itọju nigbagbogbo ni aibikita.
Aabo ati awọn ela akiyesi le dagba bi awọn eto ṣe di eka sii.
Ilana Ilana imuse
Ṣetumo lairi, didara, ati awọn ibi-afẹde idiyele ṣaaju imuse.
Aṣepari labẹ ẹru ojulowo ati awọn ipo data.
Abojuto ohun elo fun awọn aṣiṣe, fiseete, ati ipa olumulo.
Mura ipadasẹhin pada ati awọn ipa ọna esi iṣẹlẹ ṣaaju iwọn.
Tesiwaju Ṣiṣawari
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Fully Sharded Data Parallel quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Itọsọna atẹle
Data Parallelism
Awọn ibeere ti a beere nigbagbogbo
What is Fully Sharded Data Parallel?
Parallel Data Sharded ni kikun (FSDP) jẹ ilana ikẹkọ pinpin ti o pin awọn ayewọn awoṣe, awọn gradients, ati awọn ipinlẹ iṣapeye kọja ọpọlọpọ awọn GPUs nitorinaa ẹrọ kọọkan mu bibẹ pẹlẹbẹ kan nikan. O jẹ ki ikẹkọ awọn awoṣe nla ṣee ṣe lori ohun elo ti ko le baamu gbogbo awoṣe rara ni iranti GPU kan.
Kini FSDP shard kọja awọn GPUs pe afiwera data boṣewa kii ṣe?
FSDP shards awoṣe ká sile, gradients, ati awọn ipinlẹ iṣapeye kọja awọn ẹrọ, ko da awọn boṣewa data parallelism ṣe atunṣe ni kikun awoṣe lori gbogbo GPU.
Iṣiṣẹ apapọ wo ni FSDP nlo lati tun ṣe awọn iwuwo kikun Layer kan ni deede ṣaaju ṣiṣe iširo rẹ?
Ṣaaju ki fẹlẹfẹlẹ kan to ṣiṣẹ, FSDP ṣe apejọ gbogbo lati ṣajọ awọn aye pipe fun igba diẹ lati gbogbo awọn shards, lẹhinna tu wọn silẹ lẹhinna.
Kini idi ti FSDP ṣe ominira awọn iwuwo kikun ti o pejọ lẹsẹkẹsẹ lẹhin iṣiro Layer kan?
Dimu shard nikan patapata ati apejọ awọn iwuwo ni kikun ni igba diẹ jẹ ohun ti o jẹ ki lilo iranti jẹ kekere ati aijọju iwọn si ida kan ti awoṣe.
FSDP ni atilẹyin pupọ nipasẹ ọna iṣapeye iranti iṣaaju?
Pipin FSDP ti awọn paramita, gradients, ati awọn ipinlẹ iṣapeye ni pẹkipẹki tẹle awọn imọran ti a ṣe sinu Microsoft's ZeRO lati ile-ikawe DeepSpeed.
Bawo ni FSDP ṣe tọju pupọ ti aipe nẹtiwọọki lati ikojọpọ awọn iwuwo?
FSDP ṣapejuwe awọn aye ti Layer ti o tẹle lakoko ti Layer ti isiyi tun n ṣe iṣiro, ni agbekọja ibaraẹnisọrọ gbogbo-kojọpọ pẹlu iṣẹ iwulo.