Nini kilitokea
Timu ya utafiti ilianzisha SHIFT-LLM, mfumo wa kusahihisha bila mafunzo kwa miundo mikubwa ya lugha ambayo vitalu vya Transfoma vimeondolewa ili kupunguza gharama za marejeleo. Mbinu hii huingiza Adapta ya Mabaki ya Linear katika kila tovuti ya kupogoa na kuirejesha kwa urejeshaji wa urejeshaji wa umbo funge wa mraba-mraba mdogo kwa kutumia hifadhidata ndogo iliyoshikiliwa. Karatasi inaripoti tathmini katika familia tano za mfano, vigezo sita vya uteuzi wa safu na alama saba zisizo na sifuri, na urejeshaji wa usahihi katika usanidi mwingi uliojaribiwa.
Karatasi inaelezea upogoaji wa kina kama njia ya kupunguza gharama ya makisio ya miundo mikubwa ya lugha kwa kuondoa vizuizi vyote vya Transfoma. Kulingana na waandishi, hii inaunda mabadiliko ya usambazaji: majimbo yaliyofichwa yaliyotolewa baada ya kizuizi kilichoondolewa hailingani tena na usambazaji unaotarajiwa na tabaka za chini. Kutolingana kunaweza kusababisha upotevu mkubwa wa usahihi ingawa muundo uliosalia bado una muundo wake asilia. SHIFT-LLM imewasilishwa kama mfumo wa kusahihisha tatizo hili mahususi, na kufanya mwingiliano kati ya uondoaji wa safu na tabia ya modeli ya chini kuwa mada kuu ya kazi.
Sehemu inayopendekezwa ni Adapta ya Mabaki ya Linear, au LRA, iliyowekwa katika kila eneo ambapo kizuizi kimekatwa. Adapta huhifadhi njia ya utambulisho wa kizuizi cha awali cha mabaki na huongeza masahihisho ya mabaki ya uzani mwepesi. Waandishi wanasema masahihisho haya yamewekwa kupitia urejeshaji wa urejeshaji wa miraba iliyofungwa kwenye seti ndogo ya urekebishaji iliyoshikiliwa. Haihitaji hesabu ya gradient. Katika maelezo ya karatasi, LRA inakusudiwa kukadiria masasisho ya mabaki ambayo yangetolewa na kizuizi kilichoondolewa, huku ikiepuka uzingatiaji na ukokotoaji wa usambazaji-mbele unaohusishwa na kizuizi hicho.
Chanzo hicho kinaripoti kuwa njia hiyo ilijaribiwa kwa familia tano za mfano, vigezo sita vya kuchagua tabaka za kuondoa na alama saba za risasi sifuri. Inasema kwamba SHIFT-LLM mara kwa mara ilipata usahihi uliopotea kupitia kupogoa kwa kina katika usanidi mwingi, na uboreshaji wa juu wa asilimia 15.7 ya pointi kwenye Llama-3.1-8B-Instruct. Chanzo hakitoi majina ya alama, alama za msingi, uwiano wa kupogoa, vipimo vya maunzi au matokeo ya kila modeli katika maandishi yaliyotolewa. Pia haisemi kwamba mbinu hiyo imetolewa tena kwa kujitegemea au kuunganishwa katika bidhaa ya kibiashara.
Maelezo ya chanzo: arxiv.org ↗
Kwa nini ni muhimu
Kuondoa safu nzima kunaweza kupunguza gharama ya kuendesha LLM lakini kunaweza pia kutatiza uwakilishi wa ndani unaotarajiwa na tabaka za baadaye. SHIFT-LLM imeundwa kushughulikia ubadilishanaji huo kwa masahihisho mepesi badala ya kurejesha umakini ulioondolewa na hesabu za usambazaji wa mbele. Ikiwa matokeo yaliyoripotiwa yanajumlisha, mbinu hiyo inaweza kufanya miundo ya lugha iliyobanwa kuwa ya vitendo zaidi ambapo gharama ya makisio, kumbukumbu au muda wa kusubiri umebanwa.
Suala la kivitendo linaloshughulikiwa na karatasi ni biashara ya ukandamizaji inayojulikana: muundo mdogo au duni unaweza kuwa wa bei nafuu kuendesha, lakini usahihi wake unaweza kuanguka kwa sababu kuondoa tabaka hubadilisha ishara za ndani zinazopitishwa kupitia mtandao. Mchango wa karatasi ni kulenga hali hiyo ya kutofaulu moja kwa moja badala ya kutibu modeli iliyokatwa kama modeli ndogo ya kawaida. Hili ni muhimu kwa sababu gharama ya makisio haiathiriwi na hesabu ya vigezo pekee bali pia na kiasi cha umakini na ukokotoaji unaofanywa kwa kila ingizo.
Utaratibu wa urekebishaji ulioripotiwa wa SHIFT-LLM unaweza kuwa muhimu kwa sababu hautegemei urekebishaji kulingana na upinde rangi. Waandishi wanasema ni sampuli mia chache tu za urekebishaji zinahitajika na kwamba adapta zinaweza kuwekwa regression ya fomu iliyofungwa. Hiyo inaweza kupunguza data, kumbukumbu na mzigo wa kihandisi unaohusishwa na kurejesha ubora baada ya kupogoa. Uainishaji unaopendekezwa wa kiwango cha chini na uunganisho kamili katika tabaka zilizokatwa mfululizo pia huwasilishwa kama njia za kuongeza mgandamizo zaidi. Haya ni madai kuhusu muundo wa mbinu na majaribio yaliyoripotiwa, si ushahidi kwamba kila utumaji utafikia akiba sawa.
Kazi pia inaangazia kwa nini mfinyazo wa modeli hauwezi kutathminiwa kwa kuhesabu vigezo au tabaka zilizoondolewa. Muundo uliopogolewa unaweza kuwa mdogo kimuundo huku ukiwa bado una matatizo ya usambazaji wa ndani unaoathiri ubora wa matokeo. Ikiwa urejeshaji ulioripotiwa ni thabiti, safu za urekebishaji nyepesi zinaweza kuwapa wasanidi programu chaguo jingine kati ya kuendesha muundo kamili na kukubali upotevu wa usahihi wa kupogoa kwa nguvu. Umuhimu wa umma unabakia kuwekewa mipaka, hata hivyo: chanzo kilichotolewa hakihesabu matumizi ya nishati, gharama ya kuhudumia, kusubiri mwisho hadi mwisho au utendakazi katika programu za kiwango cha juu.
Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli
Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.
Which component of an AI application is the machine-learning model itself?
Nini cha kutazama baadaye
Maswali kuu yaliyo wazi ni jinsi mbinu hii inavyofanya kazi nje ya vigezo vilivyoripotiwa, ni kiasi gani cha data ya urekebishaji na hesabu iliyoongezwa inahitajika katika mazoezi, na ikiwa faida zake zinaendelea katika kazi, lugha na mazingira ya utumaji. Chanzo ni chapa ya awali ya arXiv na haiainishi urudiaji huru, upatikanaji wa uzalishaji, matokeo ya kina ya muda wa kusubiri au hali kamili za majaribio nyuma ya faida ya juu iliyoripotiwa.
Suala la kwanza la kutazama ni reproducibility. Chanzo kinabainisha karatasi kama toleo la kwanza la uwasilishaji wa arXiv na muhtasari wa matokeo yake, lakini maandishi yaliyotolewa hayajumuishi majedwali ya kimsingi, tafiti za uondoaji au maelezo ya utekelezaji. Majaribio ya kujitegemea yatahitaji kuchunguza ikiwa faida zilizoripotiwa ziko chini ya asilimia tofauti za kupogoa, saizi tofauti zilizowekwa za urekebishaji na chaguo tofauti za tabaka za kuondoa. Pia zingehitaji kulinganisha SHIFT-LLM dhidi ya kujizoeza tena, kunereka, usanifu wa kawaida na mbinu zingine za ukandamizaji chini ya bajeti ya kukokotoa thabiti.
Vipimo vya kupeleka vitakuwa muhimu. Jarida linasema LRAs huepuka uangalizi wa gharama kubwa na hesabu za kusambaza malisho za vizuizi vilivyoondolewa na kuunga mkono uainishaji wa hali ya chini na uunganisho, lakini chanzo hakiripoti ukawiaji halisi, matumizi ya kumbukumbu, matokeo au matokeo ya maunzi. Adapta zilizoongezwa zinaweza kuwa na athari tofauti kulingana na mfumo wa uelekezaji na ikiwa utendakazi mfululizo unaweza kuunganishwa. Kwa hivyo, tathmini ya vitendo inapaswa kupima jumla ya gharama ya huduma, sio tu urejeshaji wa usahihi au idadi ya vigezo vilivyoondolewa.
Upeo wa jumla ni mwingine usiojulikana. Tathmini iliyoripotiwa inahusisha familia tano za kielelezo na vigezo saba vya risasi sifuri, lakini muhtasari uliotolewa hautambui kazi, lugha, ukubwa wa modeli zaidi ya tokeo la Maagizo la Llama-3.1-8B, au tabia ya mbinu ya kufuata maagizo, matumizi ya muktadha mrefu, usimbaji au tathmini za usalama. Chanzo pia hakibainishi ikiwa data ya urekebishaji lazima ifanane na pembejeo za usambazaji. Karatasi za siku zijazo au msimbo uliotolewa unaweza kufafanua mapungufu haya na kuonyesha kama mbinu hiyo ni ya manufaa kwa upana au yenye ufanisi kwa usanifu fulani na mifumo ya kupogoa.