Rudi kwa Habari
UbunifuAI Understanding muhtasari

SHIFT-LLM inaripoti njia isiyo na mafunzo ya kurejesha usahihi baada ya kupogoa safu za LLM

Chapisho mpya ya awali inafafanua SHIFT-LLM, mbinu ya kusahihisha baada ya kupogoa ambayo hutumia adapta za laini nyepesi kukadiria hesabu zilizoondolewa kutoka kwa miundo mikubwa ya lugha. Waandishi wanaripoti faida za usahihi za hadi pointi 15.7 kwenye Llama-3.1-8B-Agiza katika viwango saba vya risasi sifuri.

5 min readRead the primary source
Primary-source image accompanying SHIFT-LLM reports a training-free way to recover accuracy after pruning LLM layers
Hati ya chanzo msingiChanzo kimerekodiwa
Mchapishaji
arxiv.org
Kiungo cha chanzo
arxiv.orghttps://arxiv.org/abs/2608.25068
Aina ya chanzo
Hati ya msingi - tangazo rasmi, karatasi, faili, au ukurasa wa mtu wa kwanza tunasoma moja kwa moja.
MuktadhaElewa hili katika sekunde 60

Anzia hapa

Masharti muhimu

Muundo wa Lugha Kubwa (LLM)
Muundo wa lugha uliofunzwa kwenye shirika kubwa la maandishi ili kuunda na kuchanganua maandishi.
Kupogoa
Kuondoa uzito wa kielelezo au nyuroni zisizo muhimu sana ili kupunguza ukubwa na kukokotoa.
Kumbukumbu (Kumbukumbu ya Wakala)
Muktadha uliohifadhiwa wakala wa AI hutumia katika hatua au vipindi ili kuboresha mwendelezo.
Jijaribu mwenyeweMaswali Yanayofafanuliwa kwa Miundo ya AI

Nini kilitokea

Timu ya utafiti ilianzisha SHIFT-LLM, mfumo wa kusahihisha bila mafunzo kwa miundo mikubwa ya lugha ambayo vitalu vya Transfoma vimeondolewa ili kupunguza gharama za marejeleo. Mbinu hii huingiza Adapta ya Mabaki ya Linear katika kila tovuti ya kupogoa na kuirejesha kwa urejeshaji wa urejeshaji wa umbo funge wa mraba-mraba mdogo kwa kutumia hifadhidata ndogo iliyoshikiliwa. Karatasi inaripoti tathmini katika familia tano za mfano, vigezo sita vya uteuzi wa safu na alama saba zisizo na sifuri, na urejeshaji wa usahihi katika usanidi mwingi uliojaribiwa.

Karatasi inaelezea upogoaji wa kina kama njia ya kupunguza gharama ya makisio ya miundo mikubwa ya lugha kwa kuondoa vizuizi vyote vya Transfoma. Kulingana na waandishi, hii inaunda mabadiliko ya usambazaji: majimbo yaliyofichwa yaliyotolewa baada ya kizuizi kilichoondolewa hailingani tena na usambazaji unaotarajiwa na tabaka za chini. Kutolingana kunaweza kusababisha upotevu mkubwa wa usahihi ingawa muundo uliosalia bado una muundo wake asilia. SHIFT-LLM imewasilishwa kama mfumo wa kusahihisha tatizo hili mahususi, na kufanya mwingiliano kati ya uondoaji wa safu na tabia ya modeli ya chini kuwa mada kuu ya kazi.

Sehemu inayopendekezwa ni Adapta ya Mabaki ya Linear, au LRA, iliyowekwa katika kila eneo ambapo kizuizi kimekatwa. Adapta huhifadhi njia ya utambulisho wa kizuizi cha awali cha mabaki na huongeza masahihisho ya mabaki ya uzani mwepesi. Waandishi wanasema masahihisho haya yamewekwa kupitia urejeshaji wa urejeshaji wa miraba iliyofungwa kwenye seti ndogo ya urekebishaji iliyoshikiliwa. Haihitaji hesabu ya gradient. Katika maelezo ya karatasi, LRA inakusudiwa kukadiria masasisho ya mabaki ambayo yangetolewa na kizuizi kilichoondolewa, huku ikiepuka uzingatiaji na ukokotoaji wa usambazaji-mbele unaohusishwa na kizuizi hicho.

Chanzo hicho kinaripoti kuwa njia hiyo ilijaribiwa kwa familia tano za mfano, vigezo sita vya kuchagua tabaka za kuondoa na alama saba za risasi sifuri. Inasema kwamba SHIFT-LLM mara kwa mara ilipata usahihi uliopotea kupitia kupogoa kwa kina katika usanidi mwingi, na uboreshaji wa juu wa asilimia 15.7 ya pointi kwenye Llama-3.1-8B-Instruct. Chanzo hakitoi majina ya alama, alama za msingi, uwiano wa kupogoa, vipimo vya maunzi au matokeo ya kila modeli katika maandishi yaliyotolewa. Pia haisemi kwamba mbinu hiyo imetolewa tena kwa kujitegemea au kuunganishwa katika bidhaa ya kibiashara.

Maelezo ya chanzo: arxiv.org ↗

Kwa nini ni muhimu

Kuondoa safu nzima kunaweza kupunguza gharama ya kuendesha LLM lakini kunaweza pia kutatiza uwakilishi wa ndani unaotarajiwa na tabaka za baadaye. SHIFT-LLM imeundwa kushughulikia ubadilishanaji huo kwa masahihisho mepesi badala ya kurejesha umakini ulioondolewa na hesabu za usambazaji wa mbele. Ikiwa matokeo yaliyoripotiwa yanajumlisha, mbinu hiyo inaweza kufanya miundo ya lugha iliyobanwa kuwa ya vitendo zaidi ambapo gharama ya makisio, kumbukumbu au muda wa kusubiri umebanwa.

Suala la kivitendo linaloshughulikiwa na karatasi ni biashara ya ukandamizaji inayojulikana: muundo mdogo au duni unaweza kuwa wa bei nafuu kuendesha, lakini usahihi wake unaweza kuanguka kwa sababu kuondoa tabaka hubadilisha ishara za ndani zinazopitishwa kupitia mtandao. Mchango wa karatasi ni kulenga hali hiyo ya kutofaulu moja kwa moja badala ya kutibu modeli iliyokatwa kama modeli ndogo ya kawaida. Hili ni muhimu kwa sababu gharama ya makisio haiathiriwi na hesabu ya vigezo pekee bali pia na kiasi cha umakini na ukokotoaji unaofanywa kwa kila ingizo.

Utaratibu wa urekebishaji ulioripotiwa wa SHIFT-LLM unaweza kuwa muhimu kwa sababu hautegemei urekebishaji kulingana na upinde rangi. Waandishi wanasema ni sampuli mia chache tu za urekebishaji zinahitajika na kwamba adapta zinaweza kuwekwa regression ya fomu iliyofungwa. Hiyo inaweza kupunguza data, kumbukumbu na mzigo wa kihandisi unaohusishwa na kurejesha ubora baada ya kupogoa. Uainishaji unaopendekezwa wa kiwango cha chini na uunganisho kamili katika tabaka zilizokatwa mfululizo pia huwasilishwa kama njia za kuongeza mgandamizo zaidi. Haya ni madai kuhusu muundo wa mbinu na majaribio yaliyoripotiwa, si ushahidi kwamba kila utumaji utafikia akiba sawa.

Kazi pia inaangazia kwa nini mfinyazo wa modeli hauwezi kutathminiwa kwa kuhesabu vigezo au tabaka zilizoondolewa. Muundo uliopogolewa unaweza kuwa mdogo kimuundo huku ukiwa bado una matatizo ya usambazaji wa ndani unaoathiri ubora wa matokeo. Ikiwa urejeshaji ulioripotiwa ni thabiti, safu za urekebishaji nyepesi zinaweza kuwapa wasanidi programu chaguo jingine kati ya kuendesha muundo kamili na kukubali upotevu wa usahihi wa kupogoa kwa nguvu. Umuhimu wa umma unabakia kuwekewa mipaka, hata hivyo: chanzo kilichotolewa hakihesabu matumizi ya nishati, gharama ya kuhudumia, kusubiri mwisho hadi mwisho au utendakazi katika programu za kiwango cha juu.

Interactive Mechanism

Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli

Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Ukaguzi wa Dhana ya Kuingiliana+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Nini cha kutazama baadaye

Maswali kuu yaliyo wazi ni jinsi mbinu hii inavyofanya kazi nje ya vigezo vilivyoripotiwa, ni kiasi gani cha data ya urekebishaji na hesabu iliyoongezwa inahitajika katika mazoezi, na ikiwa faida zake zinaendelea katika kazi, lugha na mazingira ya utumaji. Chanzo ni chapa ya awali ya arXiv na haiainishi urudiaji huru, upatikanaji wa uzalishaji, matokeo ya kina ya muda wa kusubiri au hali kamili za majaribio nyuma ya faida ya juu iliyoripotiwa.

Suala la kwanza la kutazama ni reproducibility. Chanzo kinabainisha karatasi kama toleo la kwanza la uwasilishaji wa arXiv na muhtasari wa matokeo yake, lakini maandishi yaliyotolewa hayajumuishi majedwali ya kimsingi, tafiti za uondoaji au maelezo ya utekelezaji. Majaribio ya kujitegemea yatahitaji kuchunguza ikiwa faida zilizoripotiwa ziko chini ya asilimia tofauti za kupogoa, saizi tofauti zilizowekwa za urekebishaji na chaguo tofauti za tabaka za kuondoa. Pia zingehitaji kulinganisha SHIFT-LLM dhidi ya kujizoeza tena, kunereka, usanifu wa kawaida na mbinu zingine za ukandamizaji chini ya bajeti ya kukokotoa thabiti.

Vipimo vya kupeleka vitakuwa muhimu. Jarida linasema LRAs huepuka uangalizi wa gharama kubwa na hesabu za kusambaza malisho za vizuizi vilivyoondolewa na kuunga mkono uainishaji wa hali ya chini na uunganisho, lakini chanzo hakiripoti ukawiaji halisi, matumizi ya kumbukumbu, matokeo au matokeo ya maunzi. Adapta zilizoongezwa zinaweza kuwa na athari tofauti kulingana na mfumo wa uelekezaji na ikiwa utendakazi mfululizo unaweza kuunganishwa. Kwa hivyo, tathmini ya vitendo inapaswa kupima jumla ya gharama ya huduma, sio tu urejeshaji wa usahihi au idadi ya vigezo vilivyoondolewa.

Upeo wa jumla ni mwingine usiojulikana. Tathmini iliyoripotiwa inahusisha familia tano za kielelezo na vigezo saba vya risasi sifuri, lakini muhtasari uliotolewa hautambui kazi, lugha, ukubwa wa modeli zaidi ya tokeo la Maagizo la Llama-3.1-8B, au tabia ya mbinu ya kufuata maagizo, matumizi ya muktadha mrefu, usimbaji au tathmini za usalama. Chanzo pia hakibainishi ikiwa data ya urekebishaji lazima ifanane na pembejeo za usambazaji. Karatasi za siku zijazo au msimbo uliotolewa unaweza kufafanua mapungufu haya na kuonyesha kama mbinu hiyo ni ya manufaa kwa upana au yenye ufanisi kwa usanifu fulani na mifumo ya kupogoa.

Miongozo & maswali yanayohusiana

Mifano ya AI ImefafanuliwaTransfomaMafunzo ya AIMustakabali wa AIJaribu unachojua - jaribu maswali ya AI bila malipoTafuta istilahi ya AI katika faharasa yetuFuata kifuatiliaji cha toleo la muundo wa AI
Je, umepata hii kuwa muhimu?