Lugha AI MWONGOZO

Kuongeza Dirisha la Muktadha wa Uzi

UZI (Bado upanuzi mwingine wa RoPE) ni mbinu inayonyosha kidirisha cha muktadha kinachoweza kutumika cha kibadilishaji mbali zaidi ya kile kilichofunzwa, kwa urekebishaji mdogo.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It matters because it lets existing models handle much longer documents without retraining from scratch.

Dive ya kina

LLM nyingi za kisasa husimba nafasi za maneno kwa kutumia Rotary Position Embeddings (Kamba), ambazo hufanya kazi vizuri tu hadi urefu ambao modeli iliona wakati wa mafunzo. Lisha kwa mlolongo mrefu na mtindo huharibika vibaya. YaRN hutatua hili kwa kuongeza kasi ya masafa ya mzunguko wa RoPE kwa njia ya kufahamu mara kwa mara: vipimo vya masafa ya juu (ambavyo vinanasa uhusiano wa karibu, wa karibu) huachwa bila kuguswa, huku vipimo vya masafa ya chini (ambavyo vinakamata nafasi ya masafa marefu) vimechanganuliwa. Pia huongeza urekebishaji wa halijoto kwa umakini ili kuweka kumbukumbu zikiwa na tabia njema katika masafa marefu. Matokeo, yanayoonyeshwa kwenye miundo ya LLaMA, huongeza muktadha kutoka tokeni za 4K hadi 64K-128K kwa kutumia takriban 0.1% tu ya data ya awali ya mafunzo na hatua mia chache za kurekebisha vyema.

Ufahamu wa Kiufundi

RoPE huzungusha swala na vekta muhimu kwa pembe sawia na nafasi na masafa ya kila mwelekeo. Ufafanuzi wa mstari wa Naive (Ufafanuzi wa Nafasi) hupunguza masafa yote kwa usawa, na kudhuru maelezo ya ndani. Uzi badala yake hutumika 'NTK-kwa-sehemu': huingiliana tu vipimo vya masafa ya chini (refu-wavelength), huacha pekee za masafa ya juu, na njia panda kati yao. Kuongeza joto la umakini hufidia mabadiliko ya entropy, kuhifadhi usahihi kwa urefu uliopanuliwa.

Athari za kimkakati

Kasi na kiwango

Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.

Kufikia na kufikia

Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.

Maamuzi ya wazi zaidi

Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.

Mustakabali wa Kuongeza Dirisha la Muktadha wa Uzi

Kiendelezi cha kufahamu frequency cha mtindo wa YaRN kimekuwa kiungo chaguo-msingi cha kusafirisha miundo ya muktadha mrefu; lahaja na vifuatavyo vinaendelea kuonekana huku maabara zikisukuma madirisha ya ishara milioni. Tarajia muunganisho mkali zaidi kwa umakini mzuri, mgandamizo wa akiba ya KV, na kuongeza kasi ambayo hubadilika kwa kuruka kwa kila ombi. Mwelekeo mpana zaidi ni kutenganisha 'muda gani mtindo ulifunzwa' kutoka 'muda gani unaweza kusoma kwa manufaa,' na kufanya muktadha mrefu kuwa kipengele cha bei nafuu cha baada ya mafunzo badala ya kujitolea kwa gharama kubwa ya usanifu.

Utekelezaji wa Ulimwengu Halisi

Kupanua muundo wa wazi wa LLaMA kutoka tokeni 4K hadi 128K ili iweze kumeza codebase nzima au mkataba mrefu kwa pasi moja.

Kuruhusu chatbot kuhifadhi historia ndefu sana za mazungumzo bila kupunguza zamu za mapema

Kufupisha hati za urefu wa kitabu au nakala za saa nyingi zinazozidi kidirisha asili cha muundo msingi

Kurekebisha kwa bei nafuu kielelezo kilichofunzwa awali kwa kazi za kurejesha muktadha mrefu kwa kutumia tu uendeshaji mdogo wa urekebishaji.

Hatari & Walinzi

Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.

Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.

Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.

Ramani ya Utekelezaji

1

Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.

2

Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.

3

Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.

4

Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN Context Window Scaling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Muktadha Windows

Maswali yanayoulizwa mara kwa mara

What is YaRN Context Window Scaling?

UZI (Bado upanuzi mwingine wa RoPE) ni mbinu inayonyosha kidirisha cha muktadha kinachoweza kutumika cha kibadilishaji mbali zaidi ya kile kilichofunzwa, kwa urekebishaji mdogo. Ni muhimu kwa sababu huruhusu miundo iliyopo kushughulikia hati ndefu zaidi bila kujifunzwa tena kutoka mwanzo.

Je, ni mpango gani wa usimbaji nafasi ambao YaRN hurekebisha ili kupanua urefu wa muktadha?

YaRN inawakilisha 'Yet another RoPE extension' na inafanya kazi kwa kupunguza kasi ya mzunguko inayotumika katika Upachikaji wa Mkao wa Rotary.

Je, YaRN hushughulikia vipi vipimo vya RoPE ya masafa ya juu dhidi ya masafa ya chini?

Mbinu ya 'NTK-by-sehemu' ya YaRN huhifadhi vipimo vya masafa ya juu (ya ndani) huku ikiingiliana na vile vya masafa ya chini (masafa marefu) ili kuepuka kudhuru maelezo ya ndani.

Ni faida gani kuu ya ufanisi ya YaRN juu ya kufunza muundo wa muktadha mrefu kutoka mwanzo?

YaRN inaweza kupanua muktadha kwa kutumia takriban 0.1% ya data ya awali ya mafunzo na idadi ndogo ya hatua za kurekebisha vizuri, nafuu zaidi kuliko kujizoeza tena.

Kando na kuongeza kasi ya masafa, ni marekebisho gani ya ziada ambayo YaRN hutumika ili kuweka umakini wa masafa marefu kuwa thabiti?

YaRN hurekebisha halijoto ya umakini ili kufidia mabadiliko ya entropy/logi ambayo hutokea wakati mfuatano unachukua muda mrefu zaidi.

Ni shida gani hutokea ikiwa unalisha mlolongo wa mfano wa RoPE kwa muda mrefu zaidi kuliko ulivyofunzwa, bila kuongeza yoyote?

Kamba haifanyiki kwa ujumla nafasi ndefu zisizoonekana, kwa hivyo ubora huporomoka isipokuwa masafa yamepunguzwa.