MWONGOZO wa Kiufundi

Data Iliyoshirikiwa Kamili Sambamba

Uwiano wa Data Iliyoshirikiwa Kamili (FSDP) ni mbinu ya mafunzo iliyosambazwa ambayo hugawanya vigezo, viwango vya juu na viboreshaji vya modeli kwenye GPU nyingi ili kila kifaa kiwe na kipande pekee.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It makes training huge models possible on hardware that could never fit the whole model in one GPU's memory.

Dive ya kina

Usambamba wa data wa kitamaduni huweka nakala kamili ya muundo kwenye kila GPU, ambayo hupoteza kumbukumbu na ukubwa wa modeli. FSDP, iliyoangaziwa na Meta's PyTorch na kuchochewa na Microsoft ZeRO ya Microsoft, badala yake hugawanya vitu vitatu kwenye vifaa vyote: vigezo, vipenyo, na hali za viboreshaji. Wakati wa kupita mbele, kila GPU hukusanya kwa muda uzani kamili kwa safu inayojumuisha kupitia mkusanyiko wote, huendesha hesabu, kisha huweka nakala iliyokusanywa mara moja. Pasi ya kurudi nyuma hufanya kazi vivyo hivyo, ikifuatiwa na kupunguza-kutawanya ambayo inasambaza vipande vya gradient kurudi kwenye GPU zao zinazomiliki. Kwa sababu kila kifaa huhifadhi sehemu moja tu ya muundo, matumizi ya kumbukumbu hupungua takriban kulingana na idadi ya GPU, hivyo basi timu zifunze miundo yenye makumi au mamia ya mabilioni ya vigezo.

Ufahamu wa Kiufundi

FSDP hufanya biashara ya mawasiliano ya ziada kwa ajili ya kuokoa kumbukumbu. Uzito wa kila safu hujengwa upya kwa mahitaji na haki ya kukusanya yote kabla ya matumizi na kutupwa mara baada ya hapo, huku gradient huunganishwa na kugawanywa kwa kupunguza-kutawanya. Mawasiliano yanaweza kuingiliana na hesabu kwa kuleta awali vigezo vya safu inayofuata wakati safu ya sasa inaendesha, kuficha muda mwingi wa kusubiri wa mtandao. Kurekebisha uzito wa kugawanyika (sera ya kukunja) husawazisha alama ya kumbukumbu dhidi ya sehemu ya juu ya mawasiliano.

Athari za kimkakati

Cost and budget

Maamuzi ya usanifu huendesha utendaji na gharama ya uendeshaji kwa miaka.

Maamuzi ya wazi zaidi

Elimu ya kiufundi husaidia timu kuchagua safu sahihi, sio tu mpya zaidi.

Quality control

Chaguo bora za uhandisi hupunguza matukio ya kuaminika katika uzalishaji.

Mustakabali wa Data Iliyoshirikiwa Kabisa

FSDP inakuwa chaguo-msingi kwa mafunzo ya wazi ya miundo mikubwa, huku FSDP2 katika PyTorch ikiboresha utumiaji na ugawaji kwa kila kigezo. Tarajia muunganisho mkali zaidi wa ulinganifu wa tensor na bomba kwa miundo ya trilioni ya vigezo, usaidizi bora wa usahihi mseto na fp8, na ufungaji nadhifu wa kiotomatiki ambao unakuchagulia mipaka ya kugawa. Kadiri miunganisho ya baina ya GPU kama vile NVLink na InfiniBand inavyokua haraka, gharama ya mawasiliano ya kugawanyika huendelea kupungua, na kuifanya iwe ya vitendo katika mizani inayozidi kuwa kubwa zaidi.

Utekelezaji wa Ulimwengu Halisi

Kuboresha muundo wa Llama wa kigezo cha bilioni 70 kwenye GPU 8 ambazo kibinafsi haziwezi kuhimili uzani kamili.

Kutayarisha miundo mikubwa ya lugha kwenye maabara za AI kwa kugawanya hali za viboreshaji (ambazo hutawala kumbukumbu na Adamu) kwenye mamia ya vichapuzi.

Watafiti wanaotumia karatasi ya PyTorch ya FSDP kutoa mafunzo kwa vibadilishaji maono kwenye nguzo ya chuo kikuu bila kununua GPU kuu za 80GB.

Kuchanganya FSDP na bfloat16 ya usahihi-mchanganyiko ili kupunguza takriban nusu ya kumbukumbu na kuharakisha upitishaji wa mafunzo kwenye miundo ya aina nyingi.

Hatari & Walinzi

Kuboresha kiwango kimoja kunaweza kuficha udhaifu mkubwa wa mfumo.

Gharama za miundombinu na matengenezo mara nyingi hupunguzwa.

Mapengo ya usalama na uonekanaji yanaweza kukua kadiri mifumo inavyozidi kuwa ngumu.

Ramani ya Utekelezaji

1

Bainisha muda, ubora na malengo ya gharama kabla ya utekelezaji.

2

Benchmark chini ya mzigo halisi na hali ya data.

3

Ufuatiliaji wa ala kwa makosa, kuteleza, na athari za mtumiaji.

4

Tayarisha njia za urejeshaji na majibu ya matukio kabla ya kuongeza ukubwa.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Fully Sharded Data Parallel quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Usambamba wa data

Maswali yanayoulizwa mara kwa mara

What is Fully Sharded Data Parallel?

Uwiano wa Data Iliyoshirikiwa Kamili (FSDP) ni mbinu ya mafunzo iliyosambazwa ambayo hugawanya vigezo, viwango vya juu na viboreshaji vya modeli kwenye GPU nyingi ili kila kifaa kiwe na kipande pekee. Hufanya mafunzo ya miundo mikubwa iwezekane kwenye maunzi ambayo hayawezi kutoshea mtindo mzima katika kumbukumbu moja ya GPU.

Je, FSDP inachanganya nini kwenye GPU zote ambazo usawaziko wa kawaida wa data haufanyi?

FSDP hutenganisha vigezo, mikunjo, na viboreshaji vya modeli kwenye vifaa vyote, ilhali usawaziko wa kawaida wa data huiga muundo kamili kwenye kila GPU.

Ni operesheni gani ya pamoja ambayo FSDP hutumia kuunda tena uzani kamili wa safu kabla ya kuiweka kompyuta?

Kabla ya safu kuanza, FSDP hufanya mkusanyiko wote ili kukusanya kwa muda vigezo kamili kutoka kwa shards zote, kisha kuviweka huru baadaye.

Kwa nini FSDP huachilia uzani kamili uliokusanywa mara tu baada ya hesabu ya safu?

Kushikilia tu kipande kabisa na kukusanya uzani kamili kwa muda ndiko kunakofanya utumiaji wa kumbukumbu kuwa chini na takriban sawia na sehemu moja ya muundo.

FSDP ilichochewa kwa kiasi kikubwa na mbinu ipi ya awali ya uboreshaji kumbukumbu?

Ugawaji wa vigezo, vipunguzi, na viboreshaji vya FSDP hufuata kwa karibu mawazo yaliyoletwa katika ZeRO ya Microsoft kutoka kwa maktaba ya DeepSpeed.

FSDP inaficha vipi muda mwingi wa mtandao kutokana na kukusanya uzani?

FSDP hutanguliza vigezo vya safu inayofuata wakati safu ya sasa bado inakokotoa, ikipishana mawasiliano ya kila kitu na kazi muhimu.