Lugha AI MWONGOZO

Miundo ya Rasimu ya Kusimbua ya Kukisia

Usimbuaji wa kubahatisha hutumia modeli ndogo, ya haraka ya 'rasimu' kukisia tokeni kadhaa zijazo ambazo mtindo mkubwa huthibitisha kwa pasi moja.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It speeds up text generation 2-3x with no change to the output.

Dive ya kina

Miundo mikubwa ya lugha hutoa maandishi tokeni moja kwa wakati mmoja, na kila hatua inahitaji upitishaji kamili wa mbele kupitia mabilioni ya vigezo - polepole na kumbukumbu. Usimbuaji wa kubahatisha hushambulia hii kwa kuoanisha muundo mkubwa wa 'lengwa' na muundo wa bei nafuu wa 'rasimu'. Rasimu ya mtindo inapendekeza kwa haraka sehemu ya, tuseme, tokeni 4-8 za wagombea. Mtindo mkubwa kisha huchakata zote kwa njia moja ya mbele sambamba na hukagua kila moja. Ishara zinazofanana na kile mtindo mkubwa ungezalisha zinakubaliwa; kutolingana kwa kwanza kunarekebishwa na iliyobaki kutupwa. Kwa sababu kuthibitisha tokeni kadhaa mara moja kunagharimu takriban sawa na kutengeneza moja, ukimbiaji unaokubalika ni karibu bila malipo. Muhimu, hatua ya kukataliwa-sampuli inahakikisha usambazaji wa mwisho ni sawa na kuendesha muundo mkubwa pekee - kasi bila upotezaji wa ubora.

Ufahamu wa Kiufundi

Ujanja muhimu ni jaribio la sampuli la kukataliwa lililorekebishwa. Kwa kila tokeni iliyoandaliwa, uwezekano wa muundo lengwa unalinganishwa na wa muundo wa rasimu. Ikiwa lengo linatoa uwezekano sawa au zaidi, ishara inakubaliwa; la sivyo inakubaliwa kwa uwezekano sawa na uwiano, na ikikataliwa tokeni iliyosahihishwa inatolewa sampuli kutoka kwa usambazaji wa mabaki uliorekebishwa. Hesabu hii hufanya matokeo kuwa sawa na sampuli moja kwa moja kutoka kwa muundo mkubwa.

Athari za kimkakati

Kasi na kiwango

Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.

Kufikia na kufikia

Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.

Maamuzi ya wazi zaidi

Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.

Mustakabali wa Miundo ya Rasimu ya Kusimbua kwa Kukisia

Tarajia miundo ya rasimu kuwa miundombinu ya kawaida katika seva za uelekezaji kama vile vLLM na TensorRT-LLM. Vibadala vya kujikisia (Medusa, EAGLE) huacha muundo wa rasimu tofauti kabisa kwa kuongeza vichwa vya ubashiri vyepesi, na uandishi unaotegemea miti huthibitisha miendelezo mingi ya mgombea mara moja. Madirisha ya muktadha yanapokua na gharama za kuhudumia zikitawala, waandaaji bora zaidi, unaolingana na modeli na uthibitishaji unaofahamu maunzi utasukuma viwango vya kukubalika na upitishaji juu zaidi.

Utekelezaji wa Ulimwengu Halisi

Anthropic, OpenAI, na Google hutumia usimbaji kubahatisha ili kupunguza muda wa kusubiri na kutoa gharama kwa visaidizi vya gumzo vinavyohudumia mamilioni ya watumiaji.

vLLM na meli ya NVIDIA TensorRT-LLM usimbaji wa kubahatisha uliojengewa ndani ili wapangaji binafsi waweze kuharakisha uwekaji wa Llama au Mistral.

Kuoanisha muundo wa rasimu ya 7B na lengo la 70B (k.m., familia ya Llama-3) kwa takriban tokeni mara mbili kwa sekunde kwenye GPU moja.

Zana za kukamilisha msimbo hutumia kielelezo kidogo cha rasimu ili kupendekeza sahani ambayo muundo mkubwa zaidi huthibitisha, na kuweka mapendekezo katika kihariri haraka.

Hatari & Walinzi

Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.

Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.

Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.

Ramani ya Utekelezaji

1

Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.

2

Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.

3

Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.

4

Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding Draft Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Uhariri wa Kukisia kwa Miundo ya Msimbo

Maswali yanayoulizwa mara kwa mara

What is Speculative Decoding Draft Models?

Usimbuaji wa kubahatisha hutumia modeli ndogo, ya haraka ya 'rasimu' kukisia tokeni kadhaa zijazo ambazo mtindo mkubwa huthibitisha kwa pasi moja. Huongeza kasi ya uundaji wa maandishi 2-3x bila mabadiliko kwenye pato.

Je, ni jukumu gani la msingi la kielelezo cha 'rasimu' katika usimbuaji wa kubahatisha?

Muundo mdogo wa rasimu hukisia kwa bei nafuu tokeni zinazokuja, ambazo modeli inayolengwa kubwa kisha hukagua katika pasi moja sambamba.

Kwa nini kuthibitisha tokeni nyingi zilizoandaliwa mara moja kunaokoa muda?

Kizazi kimefungwa kwa kumbukumbu; kuangalia tokeni kadhaa katika pasi moja iliyopangwa ni karibu nafuu kama hatua moja, kwa hivyo ukimbiaji unaokubalika ni karibu bila malipo.

Ni nini hufanyika kwa tokeni zilizoandaliwa baada ya ishara ya kwanza ambayo mtindo lengwa kukataa?

Kukubalika kunaendelea hadi kutokubaliana kwa kwanza; ishara hiyo inasahihishwa na ishara zote zinazofuata hutupwa mbali.

Je, kusimbua kwa kubahatisha kunahakikishaje ubora wa pato hauharibiki?

Jaribio lililorekebishwa la sampuli za kukataliwa huhakikisha usambazaji wa mwisho wa tokeni unaolingana na sampuli moja kwa moja kutoka kwa muundo lengwa.

Ni ipi kati ya hizi ni mbinu ya 'kukisia-binafsi' ambayo inaepuka muundo tofauti wa rasimu?

Medusa na EAGLE huongeza vichwa vyepesi vya ubashiri vya ziada kwa muundo mkuu ili iweze kuandaa tokeni zake za siku zijazo.