MWONGOZO wa Kiufundi

Slurm kwa Makundi ya Mafunzo ya AI

Slurm ni meneja wa upakiaji wa chanzo huria ambaye hupanga na kuendesha kazi kwenye makundi ya kompyuta yenye utendaji wa juu, na imekuwa chaguo-msingi kwa mafunzo makubwa ya AI.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It matters because it reliably distributes massive training runs across thousands of GPUs.

Dive ya kina

Slurm (Utility Rahisi ya Linux kwa Usimamizi wa Rasilimali) ilianzia kwenye kompyuta kubwa na sasa inasimamia nguzo nyingi kubwa zaidi za mafunzo za AI duniani. Watumiaji huwasilisha hati za bechi na sbatch, wanaomba nyenzo kama vile nodi na GPU zenye maagizo kama vile --gres=gpu:8, na foleni za Slurm, hutanguliza, na kuzindua kazi. Kizinduzi chake cha srun hutoa michakato iliyoratibiwa katika sehemu zote, ambazo huoanishwa kawaida na mifumo iliyosambazwa kama PyTorch DDP na NCCL. Slurm hufuatilia uhasibu wa rasilimali, hutekeleza ugavi wa haki na mipaka ya kugawa, na hushughulikia upangaji wa kujaza ili kuweka kazi ndogo katika mapungufu. Kwa mafunzo ya kielelezo cha mipaka, timu zinategemea Slurm kudhibiti maelfu ya GPU, kuwasha upya kutoka vituo vya ukaguzi baada ya hitilafu za nodi, na kuhifadhi uwezo maalum kwa ajili ya kukimbia kwa muda mrefu kwa wiki nyingi.

Ufahamu wa Kiufundi

Daemon ya kidhibiti cha Slurm (slurmctld) hufanya maamuzi ya kuratibu huku wakala wa kuzorota kwenye kila nodi akizindua kazi na kuripoti hali. Programu-jalizi ya Rasilimali Jenerali (GRES) hufuata GPU ili kazi ziombe waziwazi. srun huweka vigezo vya mazingira (cheo, saizi ya ulimwengu, anwani kuu) ambayo ilisambaza maktaba za mafunzo zilizosomwa hadi bootstrap ya mawasiliano ya NCCL. Upangaji wa kujaza nyuma huruhusu kazi fupi kufanya kazi mapema mradi zisicheleweshe uhifadhi wa kipaumbele cha juu, na kuweka matumizi ya juu.

Athari za kimkakati

Cost and budget

Maamuzi ya usanifu huendesha utendaji na gharama ya uendeshaji kwa miaka.

Maamuzi ya wazi zaidi

Elimu ya kiufundi husaidia timu kuchagua safu sahihi, sio tu mpya zaidi.

Quality control

Chaguo bora za uhandisi hupunguza matukio ya kuaminika katika uzalishaji.

Mustakabali wa Slurm kwa Makundi ya Mafunzo ya AI

Slurm inaendelea kuongeza kupasuka kwa wingu, usaidizi wa kontena kupitia Pyxis na Enroot, na vipengele vikali vya kufahamu GPU. Vikundi vya AI vinapoongezeka kuelekea GPU 100,000-pamoja, tarajia ustahimilivu mkubwa zaidi wa makosa, muunganisho otomatiki wa kuanzisha upya kituo, na kazi nyororo ambazo hurekebisha ukubwa baada ya kushindwa. Mashirika mengi sasa yanaendesha Slurm kando au chini ya Kubernetes, na wapanga ratiba wa mseto wanalenga kuchanganya ufanisi wa mtindo wa HPC na kubadilika asilia kwa wingu kwa uendeshaji mkubwa zaidi wa mafunzo.

Utekelezaji wa Ulimwengu Halisi

Maabara ya mipakani huzindua mafunzo ya wiki nyingi yanayopitia maelfu ya GPU kwa hati moja ya mkupuo inayoomba mamia ya nodi.

Mtafiti anawasilisha 'srun --gres=gpu:8' ili kunyakua GPU nane kwenye nodi moja kwa jaribio la PyTorch DDP.

Upangaji wa kujaza nyuma huweka kazi fupi ya tathmini kuwa GPU ambazo hazifanyi kazi huku mbio kubwa ya mafunzo iliyohifadhiwa ikisubiri kuanza.

Baada ya nodi kushindwa katikati ya utekelezaji, Slurm huweka kazi tena kwenye foleni na itaanza tena kutoka kwa kituo cha ukaguzi cha hivi punde badala ya kuanza upya.

Hatari & Walinzi

Kuboresha kiwango kimoja kunaweza kuficha udhaifu mkubwa wa mfumo.

Gharama za miundombinu na matengenezo mara nyingi hupunguzwa.

Mapengo ya usalama na uonekanaji yanaweza kukua kadiri mifumo inavyozidi kuwa ngumu.

Ramani ya Utekelezaji

1

Bainisha muda, ubora na malengo ya gharama kabla ya utekelezaji.

2

Benchmark chini ya mzigo halisi na hali ya data.

3

Ufuatiliaji wa ala kwa makosa, kuteleza, na athari za mtumiaji.

4

Tayarisha njia za urejeshaji na majibu ya matukio kabla ya kuongeza ukubwa.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Slurm for AI Training Clusters quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Rafu za Mafunzo ya DeepSpeed ​​na Megatron

Maswali yanayoulizwa mara kwa mara

What is Slurm for AI Training Clusters?

Slurm ni meneja wa upakiaji wa chanzo huria ambaye hupanga na kuendesha kazi kwenye makundi ya kompyuta yenye utendaji wa juu, na imekuwa chaguo-msingi kwa mafunzo makubwa ya AI. Ni muhimu kwa sababu inasambaza mafunzo makubwa kwa maelfu ya GPU.

Watumiaji hutumia amri gani kwa kawaida kuwasilisha kazi ya kundi kwa Slurm?

sbatch huwasilisha hati ya bechi inayoelezea rasilimali na amri za kazi kwenye foleni ya Slurm.

Je, kazi ya Slurm inaomba vipi GPU?

Mfumo wa Rasilimali Jenerali (GRES) huruhusu kazi ziombe GPU kwa uwazi, kwa mfano --gres=gpu:8.

Ni sehemu gani ya Slurm hufanya maamuzi kuu ya kuratibu?

slurmctld ni daemon ya kidhibiti ambayo hupanga kazi, wakati slurmd huendesha kila nodi ili kuzindua kazi.

Kwa nini srun inashirikiana vizuri na mifumo ya mafunzo iliyosambazwa kama PyTorch DDP?

srun huzindua kazi zilizosawazishwa kwenye nodi zote na hutoa maelezo ya cheo na anwani kuu ambayo maktaba zinazosambazwa hutumia bootstrap.

Madhumuni ya kuratibu kujaza tena katika Slurm ni nini?

Ujazaji wa nyuma huboresha utumiaji kwa kuweka kazi ndogo ndogo katika mapengo ya kuratibu mradi tu hazirudishi kazi zilizohifadhiwa.