Lugha AI MWONGOZO

Quantization

Ukadiriaji hupunguza muundo wa AI kwa kuhifadhi nambari zake kwa usahihi wa chini, kwa hivyo muundo uliohitaji GPU ya kituo cha data wakati mwingine unaweza kuendeshwa kwenye kompyuta ndogo au simu.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It is the main trick that makes large language models cheap and fast enough to deploy widely.

Dive ya kina

Mtandao wa neva mara nyingi ni rundo kubwa la nambari zinazoitwa uzani, kwa kawaida huhifadhiwa kama viwango vya 16- au 32-bit vinavyoelea. Ukadiriaji huhifadhi tena uzani huo kwa kutumia biti chache, kwa kawaida 8-bit (INT8) au hata nambari 4-bit. Kutoka 16-bit hadi 4-bit hupunguza kumbukumbu takribani mara nne, kwa hivyo muundo wa kigezo cha bilioni 70 unaohitaji takriban 140GB kwa 16-bit unaweza kutoshea takriban 35GB kwa 4-bit. Nambari ndogo pia hupitia kumbukumbu haraka, ambayo kwa kawaida huongeza kasi ya kuzaliwa. Ukamataji ni usahihi: kubana anuwai ya thamani katika viwango vichache huleta hitilafu ya kuzungusha. Mbinu nzuri hupunguza upotevu huo kwa kuchagua kwa uangalifu vipengee vya kuongeza alama na kulinda uzani nyeti zaidi, kwa hivyo modeli hutenda kwa karibu sawa wakati wa kutumia sehemu ya rasilimali.

Ufahamu wa Kiufundi

Kila kundi la uzani hupata kipengele cha mizani ambacho huweka thamani halisi kwenye seti ndogo ya nambari kamili; kuzidisha nyuma kwa kipimo takriban huunda tena nambari asili. Mbinu za ukadiriaji wa baada ya mafunzo kama vile GPTQ na AWQ huchanganua seti ndogo ya data ya urekebishaji ili kuamua ni uzito gani muhimu zaidi na kuweka mizani ili kupunguza makosa ya matokeo, badala ya kuzungusha kila kitu kwa upofu. Uamilisho mara nyingi huwekwa kwa usahihi wa juu kwa sababu hutofautiana zaidi wakati wa utekelezaji. Matokeo yake ni modeli inayohifadhi nambari 4-bit lakini inakokotoa matokeo karibu sana na toleo la usahihi kamili.

Athari za kimkakati

Kasi na kiwango

Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.

Kufikia na kufikia

Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.

Maamuzi ya wazi zaidi

Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.

Mustakabali wa Quantization

Tarajia ujanibishaji kuwa chaguomsingi badala ya uboreshaji. Wauzaji wa maunzi wanaongeza usaidizi asilia wa 4-bit na hata wa chini, na mbinu kama vile mafunzo ya kujua jinsi ya kuhesabu kiasi huweka ustahimilivu kwa usahihi wa chini katika muundo tangu mwanzo, hivyo kupunguza upotevu wa usahihi zaidi. Utafiti wa uwasilishaji wa 2-bit na 1-bit (bombari) unatumika, unalenga kuendesha miundo yenye uwezo kwenye simu na chipsi zilizopachikwa. Kadiri AI ya kifaa na ya kibinafsi inavyokua, miundo bora iliyokadiriwa itakuwa muhimu katika kuendesha wasaidizi ndani ya nchi bila kutuma data kwenye wingu.

Utekelezaji wa Ulimwengu Halisi

Kuendesha muundo wa gumzo kama vile Llama ndani kwenye GPU ya mtumiaji kwa kutumia 4-bit GGUF au faili za GPTQ badala ya kuhitaji kadi nyingi za kituo cha data.

Visaidizi vya kwenye kifaa kwenye simu, ambapo miundo ya 8-bit au 4-bit huruhusu vipengele vya matamshi na maandishi kufanya kazi bila muunganisho wa mtandao.

Kupunguza gharama za uelekezaji wa wingu kwa roboti ya usaidizi kwa mteja kwa kutoa muundo wa INT8, ikitosheleza maombi zaidi kwenye kila GPU.

Vifaa vya pembeni kama vile kamera mahiri au vihisi vya IoT vinavyotumia modeli za lugha ya kuona iliyokamilishwa ndani ya vikomo vya kumbukumbu.

Hatari & Walinzi

Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.

Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.

Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.

Ramani ya Utekelezaji

1

Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.

2

Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.

3

Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.

4

Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Ukadiriaji wa Vekta iliyobaki

Maswali yanayoulizwa mara kwa mara

What is Quantization?

Ukadiriaji hupunguza muundo wa AI kwa kuhifadhi nambari zake kwa usahihi wa chini, kwa hivyo muundo uliohitaji GPU ya kituo cha data wakati mwingine unaweza kuendeshwa kwenye kompyuta ndogo au simu. Ni hila kuu inayofanya miundo mikubwa ya lugha iwe nafuu na ya haraka vya kutosha kusambaza kwa upana.

Je, quantization inabadilika nini kimsingi kuhusu mtandao wa neva?

Ukadiriaji huhifadhi tena uzani wa muundo katika usahihi wa chini wa nambari, kama vile nambari kamili za biti 8 au 4 badala ya kuelea 16- au 32-bit.

Takriban ni kumbukumbu ngapi huhifadhiwa kwa kuhamisha uzani kutoka 16-bit hadi 4-bit?

Biti 4 ni robo moja ya biti 16, kwa hivyo uhifadhi wa uzani hupungua hadi takriban robo, kama punguzo la 4x.

Ni nini upande wa chini wa quantization ya fujo?

Kuwakilisha thamani zilizo na viwango vichache huleta hitilafu ya kuwasilisha, ambayo inaweza kuharibu ubora wa pato ikiwa haitadhibitiwa kwa uangalifu.

Njia kama GPTQ na AWQ hutumia seti ndogo ya urekebishaji kwa nini?

Mbinu hizi za baada ya mafunzo huchanganua vipengee vichache vya sampuli ili kuweka vipengele vya kuongeza alama na kulinda uzani nyeti, kuweka matokeo karibu na ya awali.

Kwa nini quantization mara nyingi hufanya mfano haraka, sio mdogo tu?

Thamani za usahihi wa chini huchukua kipimo data kidogo kupakia na kusongeshwa, ambayo mara nyingi huwa kizuizi wakati wa uzalishaji, kwa hivyo makisio huharakisha.