Usimamizi wa Kumbukumbu ya GPU na Kugawanyika
Jinsi mifumo ya AI inavyotenga, kutumia tena na kurejesha kumbukumbu ndogo kwenye GPU, na kwa nini mapengo yaliyosalia (kugawanyika) yanaweza kusababisha makosa ya nje ya kumbukumbu hata wakati kumbukumbu nyingi zimesalia kitaalamu.
Muhtasari
Understanding it is key to fitting big models and avoiding mysterious crashes.
Dive ya kina
Kumbukumbu ya GPU imerekebishwa na ni ya thamani: kadi inaweza kuwa na jumla ya GB 24, 80, au 192, ikishirikiwa na uzani wa kielelezo, uwezeshaji, vijisehemu, hali za viboreshaji, na bafa za muda. Kumwita dereva kutenga kumbukumbu kwenye kila operesheni kungekuwa polepole, kwa hivyo mifumo kama PyTorch hutumia kitegaji cha kache ambacho hunyakua vizuizi vikubwa mbele na kutoa vipande vidogo, kisha kuweka vipande vilivyoachiliwa kwenye dimbwi ili kutumika tena. Ukamataji ni mgawanyiko: jinsi tensor za ukubwa tofauti zinavyotolewa na kuachiliwa, nafasi ya bure hugawanyika katika vipande vilivyotawanyika. Unaweza kuwa na GB 5 bila malipo kwa jumla lakini ushindwe kutenga tensor ya GB 2 kwa sababu hakuna pengo moja kubwa la kutosha. Hii ndiyo sababu mafunzo yanaweza kuharibika kwa makosa ambayo hayajakumbukwa licha ya kuwa na nafasi ya kusoma.
Ufahamu wa Kiufundi
Kiweka akiba cha CUDA cha PyTorch hugawanya kumbukumbu katika mikondo ya vizuizi na kutumia tena vizuizi vilivyoachiliwa vinavyolingana na saizi zilizoombwa, kuepuka simu za gharama kubwa za cudaMalloc/cudaFree. Kugawanyika hutokea wakati vitalu vilivyogawanyika haviwezi kuunganishwa tena. Zana kama vile torch.cuda.empty_cache, chaguo la PYTORCH_CUDA_ALLOC_CONF expandable_segments, na vijipicha vya kumbukumbu husaidia. Mbinu mpya zaidi huazima mawazo ya kumbukumbu-pepe, ikitengeneza kurasa za kimaumbile zisizofungamana katika safu pepe inayokaribiana ili maombi makubwa yafaulu licha ya kugawanyika.
Athari za kimkakati
Cost and budget
Maamuzi ya usanifu huendesha utendaji na gharama ya uendeshaji kwa miaka.
Maamuzi ya wazi zaidi
Elimu ya kiufundi husaidia timu kuchagua safu sahihi, sio tu mpya zaidi.
Quality control
Chaguo bora za uhandisi hupunguza matukio ya kuaminika katika uzalishaji.
Mustakabali wa Usimamizi wa Kumbukumbu ya GPU na Kugawanyika
Udhibiti wa kumbukumbu unazidi kuwa nadhifu na kurasa zaidi, ukichochewa na mifumo ya uendeshaji. Mbinu kama vile vigawaji vya mtindo wa kumbukumbu-pepe na umakini wa kurasa (hutumika kudhibiti akiba ya KV wakati wa makisio) hupunguza upotevu na kugawanyika kwa kiasi kikubwa. Tarajia mifumo kuwa chaguo-msingi ili iweze kupanuliwa, vigawaji vinavyotenganishwa, mwonekano bora zaidi kupitia wasifu uliojengewa ndani, na uunganisho mkali zaidi wa upakiaji na urejeshaji ili mfumo uchanganyike GPU, CPU, na kumbukumbu ya diski kiotomatiki ili kuweka utumiaji kuwa juu na mvurugo nadra.
Utekelezaji wa Ulimwengu Halisi
Uendeshaji wa mafunzo ambao huacha kufanya kazi na 'CUDA nje ya kumbukumbu' licha ya kumbukumbu iliyohifadhiwa kuonyesha nafasi isiyolipiwa, iliyorekebishwa kwa kuweka PYTORCH_CUDA_ALLOC_CONF ili kuwezesha sehemu zinazoweza kupanuka.
Kwa kutumia torch.cuda.memory_summary au muhtasari wa kumbukumbu ili kutambua ni vipimio vipi na mgawanyiko unakula GB 80 za GPU.
PagedAttention ya vLLM inasimamia kashe ya umakini ya KV katika kurasa za ukubwa usiobadilika ili kuhudumia maombi mengi ya gumzo kwa wakati mmoja bila kupoteza kumbukumbu.
Kupunguza ukubwa wa kundi au kuwezesha ukaguaji wa upinde rangi ili kukata kumbukumbu ya kuwezesha na kuepuka hitilafu za nje ya kumbukumbu zinazotokana na kugawanyika.
Hatari & Walinzi
Kuboresha kiwango kimoja kunaweza kuficha udhaifu mkubwa wa mfumo.
Gharama za miundombinu na matengenezo mara nyingi hupunguzwa.
Mapengo ya usalama na uonekanaji yanaweza kukua kadiri mifumo inavyozidi kuwa ngumu.
Ramani ya Utekelezaji
Bainisha muda, ubora na malengo ya gharama kabla ya utekelezaji.
Benchmark chini ya mzigo halisi na hali ya data.
Ufuatiliaji wa ala kwa makosa, kuteleza, na athari za mtumiaji.
Tayarisha njia za urejeshaji na majibu ya matukio kabla ya kuongeza ukubwa.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GPU Memory Management and Fragmentation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Upangaji wa GPU na Ochestration ya Nguzo
Maswali yanayoulizwa mara kwa mara
What is GPU Memory Management and Fragmentation?
Jinsi mifumo ya AI inavyotenga, kutumia tena na kurejesha kumbukumbu ndogo kwenye GPU, na kwa nini mapengo yaliyosalia (kugawanyika) yanaweza kusababisha makosa ya nje ya kumbukumbu hata wakati kumbukumbu nyingi zimesalia kitaalamu. Kuielewa ni ufunguo wa kufaa miundo mikubwa na kuepuka ajali za ajabu.
Mgawanyiko wa kumbukumbu ya GPU ni nini?
Kugawanyika kunamaanisha kuwa kumbukumbu ya bure inatosha, lakini imevunjwa vipande vipande, kwa hivyo hakuna pengo moja la kutosha kwa tensor kubwa.
Kwa nini mifumo kama PyTorch hutumia kigawanya kumbukumbu ya kache?
Kupiga simu kwa cudaMalloc/cudaFree kwa kila op ni polepole, kwa hivyo kiweka akiba hunyakua vizuizi vikubwa na kutumia tena vilivyoachiliwa kutoka kwa bwawa.
Unaona GB 5 bila malipo lakini huwezi kutenga tensor ya GB 2. Ni sababu gani inayowezekana?
Dalili hii ya kawaida ya kugawanyika hutokea wakati kumbukumbu isiyolipishwa ipo lakini si kama fungu moja kubwa la kutosha kwa ombi.
Ni mpangilio gani wa PyTorch unaosaidia kupunguza kugawanyika kwa kuruhusu sehemu za kumbukumbu kukua kwa urahisi?
Kuweka PYTORCH_CUDA_ALLOC_CONF ili kuwezesha sehemu_zinazoweza kupanuka huruhusu kigawaji kukuza sehemu na kupunguza hitilafu zinazohusiana na kugawanyika.
PagedAttention ya vLLM inasimamia nini kupunguza upotevu wa kumbukumbu wakati wa uelekezaji?
PagedAttention huhifadhi akiba ya KV katika kurasa za ukubwa usiobadilika kama vile kumbukumbu pepe ya OS, kukata migawanyiko na kuhudumia maombi mengi kwa ufanisi.