Nhungamiro yehunyanzvi

ZeRO uye Sharded Optimizers

ZeRO (Zero Redundancy Optimizer) inobvisa kutambisa ndangariro kudzokororwa kwedata parallelism ne sharding optimizer state, gradients, uye huremu muGPUs.

2 min verengaLast update

Pfupiso

It lets you train enormous models with the simplicity of data parallelism but a fraction of the per-GPU memory.

Kudzika Kwakadzika

Mune zvakajairwa data parallelism, yega GPU inochengeta yakawandisa kopi yakazara ye optimizer state, gradients, uye paramita, iyo inoparadza zvakanyanya, kunyanya kuna Adamu, uko optimizer nyika inogona kuwanda kanoverengeka saizi yemuenzaniso pachayo. ZeRO, yakaunzwa ne Microsoft muDeepSpeed, inobvisa iyi redundancy nekugovanisa matensor aya pamaGPU kuitira kuti mudziyo wega wega ungove nechidimbu chete. ZeRO inouya mumatanho matatu anofambira mberi: Stage 1 shards optimizer state, Stage 2 inowedzera gradient sharding, uye Stage 3 shards iyo paramita pachayo. Sezvinodiwa, maGPU anounganidza zvimedu zvisipo kuburikidza nekutaurirana, compute, wobva wazvisunungura. Mhedzisiro yacho yakadzikira zvakanyanya ndangariro paGPU, ichigonesa bhiriyoni-kusvika matrillion-parameter kudzidziswa, uku uchichengeta iri nyore hurongwa hwemhando yedata parallelism.

Technical Insight

ZeRO inotengesa kutaurirana kwekuwedzera kuchengetedza ndangariro. MuNhanho 3, isati yasvika pamberi, iyo yose-inounganidza inounganidza iyo layer izere paramita paGPU yega yega; mushure mezvo zvimedu zvisiri zvevaridzi zvinoraswa kuti zvidzore ndangariro. Gradients anodzikisira-akapararira saka yega GPU inochengeta chete gradient chidimbu chinoenderana nemaparamendi ayo anayo. PyTorch's FSDP (Fully Sharded Data Parallel) inoshandisa iyo pfungwa imwechete yekuzvarwa, kuputira mamodule kune shard uye shard panhunzi.

Strategic Impact

Mutengo uye bhajeti

Zvisarudzo zvezvivakwa zvinotyaira kuita uye mutengo wekushandisa kwemakore.

Sarudzo dzakajeka

Dzidzo yehunyanzvi inobatsira zvikwata kusarudza murwi wakakodzera, kwete iwo mutsva chete.

Kudzora kwemhando yepamusoro

Sarudzo dzeinjiniya dziri nani dzinoderedza zviitiko zvekuvimbika mukugadzira.

Ramangwana reZeRO uye Sharded Optimizers

Sharding irikuve iyo yekusarudzika kune yakakura-mwero kudzidziswa kwete yekusarudzika sarudzo. Tarisira kusanganisa kwakadzama nekudonhedza (kusundira zvimedu kuCPU kana NVMe kuburikidza neZeRO-Infinity), zvirinani kupindirana kwese-kuunganidza uye kuderedza-kuparadzira nemakomputa kuvanza mutengo wavo, uye musanganiswa ne tensor uye pombi parallelism. Sezvo mamodheru achiramba achikura, ndangariro-inoshanda sharded optimizers ari pakati pekuaisa pane echokwadi hardware bhajeti.

Real-World Implementation

Kushandisa DeepSpeed ​​ZeRO Stage 2 kukwenenzvera-mabhirioni-parameter mutauro modhi yaizofashukira GPU ndangariro.

Kudzidziswa nePyTorch FSDP, iyo shards paramita, gradients, uye optimizer nyika mhiri kweGPU uye inoaunganidza padanho pane zvinodiwa.

Kushandisa ZeRO-Offload kusundidzira optimizer state kuCPU ndangariro, ichirega imwe GPU ichidzidzisa modhi yakakura kakawanda kupfuura VRAM yayo.

Kuyera triliyoni-parameter modhi neZeRO-Infinity nekutepfenyura paramita shards kubva kuNVMe chengetedzo kana GPU neCPU ndangariro dzapera.

Njodzi & Guardrails

Kugadzirisa imwe bhenji kunogona kuvanza yakafara system kushaya simba.

Infrastructure uye mari yekugadzirisa inowanzotarisirwa pasi.

Chengetedzo uye kucherechedzwa mapundu anogona kukura sezvo masisitimu anowedzera kuoma.

Implementation Roadmap

1

Tsanangura latency, mhando, uye mutengo zvinangwa usati waitwa.

2

Benchmark pasi pechokwadi mutoro uye data mamiriro.

3

Chishandiso chekutarisa zvikanganiso, kudonha, uye mushandisi maitiro.

4

Gadzirira nzira dzekudzosera kumashure uye dzezviitiko usati wawedzera.

Ramba Uchiongorora

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ZeRO and Sharded Optimizers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Tanga mibvunzo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gaidhi rinotevera

Tarisa mberi uye Shumba Optimizers

Mibvunzo inowanzo bvunzwa

What is ZeRO and Sharded Optimizers?

ZeRO (Zero Redundancy Optimizer) inobvisa kutambisa ndangariro kudzokororwa kwedata parallelism ne sharding optimizer state, gradients, uye huremu muGPUs. Inokutendera kuti udzidzise mamodheru akakura nekureruka kwekufanana kwedata asi chidimbu cheiyo-GPU ndangariro.

Ndeipi redundancy iyo ZeRO inobvisa ichienzaniswa neyakajeka data parallelism?

Standard data parallelism inochengetedza kopi yakazara ye optimizer state, gradients, uye uremu paGPU yega yega; ZeRO shards izvi kuitira kuti GPU yega yega ibate chete chidimbu.

Nei optimizer state kazhinji iri hombe yekurangarira hogi naAdam?

Adamu anochengetedza fungidziro dzekumhanya senge yekutanga neyechipiri nguva paparameta, iyo yakasanganiswa nefp32 master huremu inogona kupfupisa saizi yemuenzaniso wega.

Chii chinoita ZeRO Stage 3 shard isingaite Stage 1 ne2?

Stage 1 shards optimizer state, Stage 2 inowedzera gradients, uye Stage 3 inoenda mberi nekugovanisa maparamita emodhi muGPUs zvakare.

MuZeRO Stage 3, iyo GPU inowana sei maparamendi akazara ainoda kuti ipfuure yekumberi?

Usati wagadzira dhizaini, iyo yose-inounganidza inounganidza yayo yakazara paramita pane yega GPU; kana zvangoitwa, zvimedu zvisiri zvevaridzi zvinosunungurwa kuti zvidzore ndangariro.

Ndeipi PyTorch inoratidzira natively inoshandisa ZeRO-maitiro sharding?

PyTorch's Fully Sharded Data Parallel (FSDP) shards paramita, gradients, uye optimizer state, kuunganidza uye kugovera patsva panhunzi, kuratidza ZeRO.