Kuongeza Dirisha la Muktadha wa Uzi
UZI (Bado upanuzi mwingine wa RoPE) ni mbinu inayonyosha kidirisha cha muktadha kinachoweza kutumika cha kibadilishaji mbali zaidi ya kile kilichofunzwa, kwa urekebishaji mdogo.
Muhtasari
It matters because it lets existing models handle much longer documents without retraining from scratch.
Dive ya kina
LLM nyingi za kisasa husimba nafasi za maneno kwa kutumia Rotary Position Embeddings (Kamba), ambazo hufanya kazi vizuri tu hadi urefu ambao modeli iliona wakati wa mafunzo. Lisha kwa mlolongo mrefu na mtindo huharibika vibaya. YaRN hutatua hili kwa kuongeza kasi ya masafa ya mzunguko wa RoPE kwa njia ya kufahamu mara kwa mara: vipimo vya masafa ya juu (ambavyo vinanasa uhusiano wa karibu, wa karibu) huachwa bila kuguswa, huku vipimo vya masafa ya chini (ambavyo vinakamata nafasi ya masafa marefu) vimechanganuliwa. Pia huongeza urekebishaji wa halijoto kwa umakini ili kuweka kumbukumbu zikiwa na tabia njema katika masafa marefu. Matokeo, yanayoonyeshwa kwenye miundo ya LLaMA, huongeza muktadha kutoka tokeni za 4K hadi 64K-128K kwa kutumia takriban 0.1% tu ya data ya awali ya mafunzo na hatua mia chache za kurekebisha vyema.
Ufahamu wa Kiufundi
RoPE huzungusha swala na vekta muhimu kwa pembe sawia na nafasi na masafa ya kila mwelekeo. Ufafanuzi wa mstari wa Naive (Ufafanuzi wa Nafasi) hupunguza masafa yote kwa usawa, na kudhuru maelezo ya ndani. Uzi badala yake hutumika 'NTK-kwa-sehemu': huingiliana tu vipimo vya masafa ya chini (refu-wavelength), huacha pekee za masafa ya juu, na njia panda kati yao. Kuongeza joto la umakini hufidia mabadiliko ya entropy, kuhifadhi usahihi kwa urefu uliopanuliwa.
Athari za kimkakati
Kasi na kiwango
Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.
Kufikia na kufikia
Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.
Maamuzi ya wazi zaidi
Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.
Mustakabali wa Kuongeza Dirisha la Muktadha wa Uzi
Kiendelezi cha kufahamu frequency cha mtindo wa YaRN kimekuwa kiungo chaguo-msingi cha kusafirisha miundo ya muktadha mrefu; lahaja na vifuatavyo vinaendelea kuonekana huku maabara zikisukuma madirisha ya ishara milioni. Tarajia muunganisho mkali zaidi kwa umakini mzuri, mgandamizo wa akiba ya KV, na kuongeza kasi ambayo hubadilika kwa kuruka kwa kila ombi. Mwelekeo mpana zaidi ni kutenganisha 'muda gani mtindo ulifunzwa' kutoka 'muda gani unaweza kusoma kwa manufaa,' na kufanya muktadha mrefu kuwa kipengele cha bei nafuu cha baada ya mafunzo badala ya kujitolea kwa gharama kubwa ya usanifu.
Utekelezaji wa Ulimwengu Halisi
Kupanua muundo wa wazi wa LLaMA kutoka tokeni 4K hadi 128K ili iweze kumeza codebase nzima au mkataba mrefu kwa pasi moja.
Kuruhusu chatbot kuhifadhi historia ndefu sana za mazungumzo bila kupunguza zamu za mapema
Kufupisha hati za urefu wa kitabu au nakala za saa nyingi zinazozidi kidirisha asili cha muundo msingi
Kurekebisha kwa bei nafuu kielelezo kilichofunzwa awali kwa kazi za kurejesha muktadha mrefu kwa kutumia tu uendeshaji mdogo wa urekebishaji.
Hatari & Walinzi
Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.
Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.
Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.
Ramani ya Utekelezaji
Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.
Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.
Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.
Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN Context Window Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Muktadha Windows
Maswali yanayoulizwa mara kwa mara
What is YaRN Context Window Scaling?
UZI (Bado upanuzi mwingine wa RoPE) ni mbinu inayonyosha kidirisha cha muktadha kinachoweza kutumika cha kibadilishaji mbali zaidi ya kile kilichofunzwa, kwa urekebishaji mdogo. Ni muhimu kwa sababu huruhusu miundo iliyopo kushughulikia hati ndefu zaidi bila kujifunzwa tena kutoka mwanzo.
Je, ni mpango gani wa usimbaji nafasi ambao YaRN hurekebisha ili kupanua urefu wa muktadha?
YaRN inawakilisha 'Yet another RoPE extension' na inafanya kazi kwa kupunguza kasi ya mzunguko inayotumika katika Upachikaji wa Mkao wa Rotary.
Je, YaRN hushughulikia vipi vipimo vya RoPE ya masafa ya juu dhidi ya masafa ya chini?
Mbinu ya 'NTK-by-sehemu' ya YaRN huhifadhi vipimo vya masafa ya juu (ya ndani) huku ikiingiliana na vile vya masafa ya chini (masafa marefu) ili kuepuka kudhuru maelezo ya ndani.
Ni faida gani kuu ya ufanisi ya YaRN juu ya kufunza muundo wa muktadha mrefu kutoka mwanzo?
YaRN inaweza kupanua muktadha kwa kutumia takriban 0.1% ya data ya awali ya mafunzo na idadi ndogo ya hatua za kurekebisha vizuri, nafuu zaidi kuliko kujizoeza tena.
Kando na kuongeza kasi ya masafa, ni marekebisho gani ya ziada ambayo YaRN hutumika ili kuweka umakini wa masafa marefu kuwa thabiti?
YaRN hurekebisha halijoto ya umakini ili kufidia mabadiliko ya entropy/logi ambayo hutokea wakati mfuatano unachukua muda mrefu zaidi.
Ni shida gani hutokea ikiwa unalisha mlolongo wa mfano wa RoPE kwa muda mrefu zaidi kuliko ulivyofunzwa, bila kuongeza yoyote?
Kamba haifanyiki kwa ujumla nafasi ndefu zisizoonekana, kwa hivyo ubora huporomoka isipokuwa masafa yamepunguzwa.