YaRN és Context Length Extension
A YaRN (Yet another RoPE extensionN) egy hatékony technika a modell használható környezeti ablakának kiterjesztésére, messze túlmutatva azon, amire a modellt betanították.
Áttekintés
It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.
Mély merülés
A legtöbb modern LLM a token pozíciókat RoPE-vel (Rotary Position Embeddings) kódolja, amely pozícióhoz kötött szögekkel forgatja el a lekérdezést és a kulcsvektorokat. Ha az edzési hossznál hosszabb sorozatokat adagol, ezek a forgatások nem látható tartományokba lépnek, és a modell összeomlik. A Bowen Peng és munkatársai által 2023-ban bevezetett YaRN ezt a frekvenciánként alkalmazott NTK-tudatos interpolációval javítja: a nagyfrekvenciás dimenziókat (amelyek rögzítik a lokális, rövid hatótávolságú kapcsolatokat) többnyire érintetlenül hagyja, míg az alacsony frekvenciájú dimenziókat (amelyek nagy hatótávolságú pozíciót követnek) interpolálnak. A YaRN hőmérséklet-beállítást is hozzáad a figyelemhez, hogy ellensúlyozza a hosszabb összefüggésekből származó entrópiaváltozásokat. Az eredmény erős hosszú távú teljesítmény, miután a naiv megközelítésekhez szükséges adatoknak és lépéseknek csak egy apró töredékén finomhangolták.
Technikai betekintés
A RoPE minden beágyazási mérethez hozzárendel egy forgási frekvenciát. A naiv lineáris interpoláció minden frekvenciát egyformán tömörít, károsítva a nagyfrekvenciás dimenziókat, amelyek finom helyi részleteket kódolnak. A YaRN egy rámpa funkciót használ, hogy csak az alacsony frekvenciájú (hosszú hullámhosszúságú) dimenziókat interpolálja, miközben megőrzi a magas frekvenciákat, plusz egy 1/sqrt(t) figyelemhőmérséklet-skálázást, amely stabilan tartja a softmax élességet a sorozat hosszának növekedésével. Ez az NTK részenkénti megközelítés sokkal kevesebb degradációval bővíti ki a környezetet.
Stratégiai hatás
Költség és költségvetés
Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.
Tisztább döntések
A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.
Minőségellenőrzés
A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.
A YaRN és a Context Length Extension jövője
A kontextusbővítés ma már bevett gyakorlat: a nyílt modellek rutinszerűen szállítanak YaRN-bővített változatokat, amelyek elérik a 128 000 tokent. A kutatás olyan módszerek felé halad, amelyek nulla vagy nullához közeli finomhangolással kiterjesztik a kontextust, kombinálják a RoPE átskálázást a figyelemminta trükkjeivel, és a minőséget a teljes ablakban fenntartják, nem csak a végein. Várható, hogy ezek a technikák szorosabban integrálódjanak az előképzésbe, így a kontextus natív, nem pedig utólagos.
Valós megvalósítás
A nyílt 4K-kontextusú modell kiterjesztése 32K-ra vagy 128K-ra a hosszú dokumentumokra vonatkozó kérdések megválaszolásához rövid finomhangolással
Lehetővé teszi a visszakereséssel kiegészített rendszerek számára, hogy csonkítás nélkül lenyeljenek sok összefűzött szakaszt
Működtető kódsegédek, amelyeknek egy teljes nagy tárolófájlra vagy több fájlra van szükségük egyetlen promptban
Alapmodell adaptálása hosszú, többfordulós beszélgetésekhez, amelyek nagy csevegési előzményeket halmoznak fel
Kockázatok és védőkorlátok
Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.
Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.
A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.
Végrehajtási ütemterv
Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.
Benchmark reális terhelési és adatviszonyok mellett.
Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.
A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN and Context Length Extension quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Pozícióinterpoláció a kontextuskiterjesztéshez
Gyakran ismételt kérdések
What is YaRN and Context Length Extension?
A YaRN (Yet another RoPE extensionN) egy hatékony technika a modell használható környezeti ablakának kiterjesztésére, messze túlmutatva azon, amire a modellt betanították. Ügyesen átméretezi a forgópozíciós beágyazásokat, így egy mondjuk 4K tokenre kiképzett modell minimális finomhangolással képes kezelni a 32K-t vagy még többet is.
Milyen pozíciókódolási módszert módosít a YaRN a kontextus kiterjesztése érdekében?
A YaRN, amelynek neve azt jelenti, még egy kötélkiterjesztésN, átskálázza a legtöbb modern LLM-ben használt forgóhelyzetű beágyazást.
Mi történik rosszul, ha egy kötélmodell a képzési hosszánál hosszabb sorozatokat lát?
Az edzésen túli pozíciók olyan elfordulási szögeket eredményeznek, amelyeket a modell soha nem látott, így a figyelem viselkedése élesen romlik.
Hogyan kezeli a YaRN a különböző RoPE frekvencia dimenziókat?
A YaRN egy NTK-by-parts rámpát használ, amely interpolálja a hosszú hullámhosszú, alacsony frekvenciájú tompításokat, és a rövid hatótávolságú, nagyfrekvenciás tompításokat többnyire érintetlenül hagyja.
A frekvenciák átméretezésén kívül milyen extra beállítást alkalmaz a YaRN?
A YaRN hőmérséklet-skálázást ad a figyelem logikához, hogy ellensúlyozza a kontextus növekedésével fellépő entrópiaeltolódásokat.
Mi a YaRN legfontosabb gyakorlati előnye a naiv interpolációval szemben?
A YaRN a naiv módszerek által igényelt adatok egy kis részének finomhangolása után erős, hosszú kontextusú minőséget ér el.