Me ya faru
Masu bincike sun kimanta hanyoyi guda biyu don sauke matsi na ƙwaƙwalwar ajiya yayin hidimar manyan nau'ikan harshe: rarraba ma'auni da cache na KV a cikin GPUs da yawa, ko matsawa da zaɓin fitar da cache na KV. Yin amfani da na'urar na'urar da aka zayyana wanda aka daidaita akan kayan aikin A100, A40, da H100, sun kwatanta farashin kowane alamu miliyan tare da latency a cikin ƙirar Llama-2 a sigogin 7B da 70B.
Takardar ta yi nazarin ƙayyadaddun ƙulle-ƙulle a cikin babban samfurin harshe na hidima: rashin isasshen daki don maɓalli-darajar, ko KV, cache. A cewar marubutan, daidaitawar tensor yana magance matsalar ta hanyar rarraba ma'aunin ƙira da ma'ajin KV a cikin na'urori biyu, huɗu, ko takwas. Wannan tsarin yana haifar da ƙarin ɗakin ƙwaƙwalwar ajiya amma yana buƙatar aiki mai ragewa a kowane Layer kuma yana ƙara lissafin kayan aikin yayin da adadin na'urori ke girma.
Madadin da aka yi nazari shine a rage cache kanta. Marubutan suna kimanta ƙididdige ƙimar KV a matakan 16-, 8-, da 4-bit, tare da ci gaba da ƙima zuwa 0.25, ma'ana cewa saitunan da aka gwada suna riƙe da sassa daban-daban na cache. Takardar ta sanya duka dabarun biyu akan madaidaicin farashin farashi: farashi akan alamomin miliyan idan aka kwatanta da latency, maimakon kwatanta ma'auni na ƙwaƙwalwar ajiya da maɓallan kayan aiki daban.
Binciken yana amfani da na'urar na'urar da aka ƙirƙira ta akan kayan aikin A100, A40, da H100. Ya ƙunshi nau'ikan Llama-2 tare da sigogi biliyan 7 da biliyan 70, digiri na tensor-parallel daga ɗaya zuwa takwas, da saitunan matsawa da aka gwada. Marubutan sun ba da rahoton cewa ba su sami giciye-daidai ba a cikin waɗannan gwaje-gwajen: matsawa ya kasance tsakanin 1.20 da sau 2.00 mai rahusa a cikin tsarin da suka gina.
Iyakar da aka ruwaito ya dogara da alaƙa tsakanin girman ƙirar da ƙwaƙwalwar na'urar. Don na'urar 80 GB, marubutan sun ce samfurin 7B ba zai iya ƙare kasafin KV ɗin sa a cikin taga mahallinsa ba, yayin da iyakar yanke shawara ta bayyana a kusan sigogi 36B. A ƙasa wannan batu, takarda ta ba da rahoton cewa matsawa ta mamaye tattalin arziki. Sama da shi, daidaitawar tensor yana magance babban ƙuntatawa lokacin da ma'aunin ƙirar ba zai iya dacewa da na'ura ɗaya ba; marubutan sun ba Llama-2 70B akan A100 guda ɗaya a matsayin misalin da ya rage ba zai yuwu ba ko da kuwa saitin KV.
Me ya sa yake da mahimmanci
Takardar ta tsara zaɓin ababen more rayuwa mai amfani ga ma'aikatan AI. Sakamakonsa yana ba da shawarar cewa matsawa na iya samar da ƙarin ƙarfin sabis a kowace dala don ƙira waɗanda suka dace da ma'auninsu akan na'ura ɗaya, yayin da daidaitawar tensor ya zama dole lokacin da ma'aunin ƙira da kansa ya zarce adadin ƙwaƙwalwar ajiya. Kasuwancin ya kasance mafi girma latency a ƙarƙashin matsawa a cikin saitunan da aka gwada.
Ƙimar da ke da amfani na takarda ita ce ta kwatanta yanke shawara biyu na kayan aikin da ake magana akai akai ta amfani da matakai daban-daban. Ƙungiya da ke yanke shawarar yadda za a yi hidimar LLM dole ne ta daidaita ƙarfin ƙwaƙwalwar ajiya, latency, da farashi. Ta hanyar bayyana hanyoyin da za a kashe a kowace alamar miliyoyin akan rashin jinkiri, binciken yana ba da tsari na gama gari don yin tunani game da wannan shawarar, kodayake sakamakon ya kasance na ƙayyadaddun ƙayyadaddun takaddun da aka tsara.
Fa'idar tattalin arziƙin da aka ruwaito shine mafi ƙarfi ga samfuran waɗanda nauyinsu ya riga ya dace akan na'ura ɗaya. A wannan yanayin, raguwar cache na KV na iya ƙara yawan aikin da ke akwai ta kayan aikin da ke akwai ba tare da buƙatar babban gungu na GPU ba. Marubutan sun ba da rahoton mai ninka 16.5-da-dala don matsawa, idan aka kwatanta da 1.21-ninka don haɓaka ninki takwas a kashe kashe GPU. Waɗannan su ne sakamakon rahoton takarda, ba garanti na gaba ɗaya ba ga duk turawa.
Latency shine tsakiyar farashi na dabarun matsawa a cikin binciken. Marubutan sun ba da rahoton cewa matsawa ya karu da latency na kowane-alamu da kashi 8% zuwa 93%, wanda suka danganta da jayayyar batching. Daidaiton Tensor shine kawai gwajin lever wanda ya inganta jinkiri. Wannan yana haifar da bayyananniyar cinikin aiki: matsawa na iya zama wanda aka fi so inda kayan aiki ko ƙarfin kowace dala suka fi dacewa, yayin da ƙarin GPUs na iya zama barata lokacin da lokacin amsawa shine farkon abin da ake bukata.
Takardar ta kuma fayyace dalilin da yasa doka ɗaya ta duk turawar LLM zata zama yaudara. Matsarin KV baya rage žwažwalwar ajiyar da ke cikin ma'aunin ƙira, don haka ba zai iya yin girman samfurin ya dace da na'ura ɗaya ba. Akasin haka, ƙara GPUs na iya magance ƙarfin nauyi amma yana iya zama wuce gona da iri don ƙaramin ƙirar wanda babban batunsa shine amfani da cache. Gudunmawar binciken don haka shawarwarin sharadi ne da ke daure da albarkatun ƙwaƙwalwar ajiya, maimakon da'awar cewa hanya ɗaya koyaushe tana maye gurbin ɗayan.
Ingantacciyar hanyar sadarwa: Yadda A zahiri yake Aiki
Bincika fasahar da ke bayan wannan ci gaban ta hanyar mu'amala.
Which component of an AI application is the machine-learning model itself?
Abin kallo na gaba
Ana buƙatar gwada abubuwan da aka gano akan ayyukan samarwa, iyalai na ƙira, buƙatun inganci, da ainihin farashin girgije ko kayan masarufi. Ƙididdigar ba ta ba da rahoton cikakken sakamako na daidaito daga ƙididdigewa ko fitarwa ba, sakamakon ingantattun na'urar kwaikwayo, ko ko iyakar ketare da aka ruwaito ta riƙe fiye da gwajin Llama-2 da nau'ikan GPU.
Ƙididdigar ƙididdiga ba ta samar da farashin gajimare ba, zato na amfani da kayan masarufi, haɗaɗɗen nauyin aiki, girman batch, ko makasudin latency da ake amfani da su don ƙididdige farashi akan kowace alamar miliyoyin. Waɗannan cikakkun bayanai za su ƙayyade yadda masu aiki cikin sauƙi za su iya fassara ma'auni da aka ruwaito cikin kasafin kuɗin hidimar nasu. Sakamakon dogara akan farashi ɗaya ko bayanin martabar amfani na iya canzawa lokacin da abubuwan shigar suka canza.
Hakanan ba a bayyana ingancin farashin matsawa a cikin tushen ba. Takardar ta bayyana ƙididdigewa da korar a matsayin kashewa “ƙarancin inganci,” amma ƙayyadaddun bayanan ba ya ba da awoyin ingantattun awoyi, ayyuka, jeri na lalacewa, ko ƙofofin da aka yi amfani da su don yanke shawarar ko tsarin ya kasance karbuwa. Ƙungiyoyin samarwa zasu buƙaci wannan bayanin kafin kula da sakamakon farashi azaman shawarwarin ƙarshe zuwa ƙarshe.
An iyakance binciken a cikin tushen zuwa girman Llama-2 guda biyu da nau'ikan GPU guda uku, kodayake yana gabatar da iyakar yanke shawara a kusan sigogin 36B don katin 80 GB. Ƙididdigar ƙididdiga ba ta tabbatar da ko wannan iyakar ta ci gaba da kasancewa ga wasu gine-gine, tsayin mahallin, ƙirar hankali, iyalai masu ƙira, ko sabbin kayan aiki. Har ila yau, ba ya faɗi yadda sakamakon ke canzawa lokacin da aka ƙididdige ma'aunin ƙira ko lokacin hidimar tsarin amfani da wasu dabarun sarrafa ƙwaƙwalwar ajiya.
Ƙarin tabbaci ya kamata ya mayar da hankali kan ƙaddamarwa na ainihi da kuma a kan daidaitawar na'urar kwaikwayo. Madogarar tana gano na'urar kwaikwayo kamar yadda aka yi bayaninta akan kayan aikin A100, A40, da H100, amma maƙasudin ba ya ba da rahoton ingantacciyar ingantacciyar ma'auni mai rai. Hakanan yana buɗe buɗe yadda matsawa da daidaitawar tensor ke yin idan aka haɗa su, ko hukuncin latency ya bambanta da tsarin zirga-zirga, da nawa masu amfani da ingancin ƙirar za su yi kasuwanci don samun ƙarfin da aka ruwaito.