Rotary Position Beágyazások
A Rotary Position Embedding (RoPE) azt kódolja, ahol az egyes tokenek egy szekvenciában helyezkednek el úgy, hogy a lekérdezést és a kulcsvektorokat a pozícióval arányos szöggel elforgatják.
Áttekintés
This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.
Mély merülés
A transzformátoroknak nincs beépített rendérzékük, ezért valahogyan hozzá kell adni a pozícióinformációkat. A korai modellek rögzített szinuszos vektorokat vagy betanított helyzetbeágyazásokat adtak a bemenetekhez. A Su és munkatársai által 2021-ben javasolt RoPE más megközelítést alkalmaz: pozícióvektor hozzáadása helyett a lekérdezésben és a kulcsvektorokban lévő méretpárokat olyan szögben forgatja el, amely a token pozíciójával nő. Amikor a modell kiszámítja a pontszorzatot az m pozícióban lévő lekérdezés és az n pozícióban lévő kulcs között, a matematika úgy működik, hogy az eredmény csak a relatív m mínusz n távolságtól függ. Ez valódi relatív helyzettudatot ad, szépen játszik a hatékony figyelemmagokkal, és simán csökkenti a figyelmet a távolsággal. A kötelet ma már Llama, Mistral, Qwen és a legtöbb modern nyitott modellben használják.
Technikai betekintés
A RoPE páronként kezeli a beágyazási méreteket, és 2D-s forgatást alkalmaz minden páron, ahol a különböző párok különböző frekvencián forognak, hasonlóan sok óra mutatóihoz, amelyek különböző sebességgel ketyegnek. Mivel az m pozícióval való elforgatás, majd az n pozícióval elforgatott pontszorzat felvétele csak a szögkülönbséget hagyja meg, a figyelempontszámok a relatív pozíció függvényeivé válnak. A nagyfrekvenciás párok finom helyi rendet rögzítenek; az alacsony frekvenciájú párok nagy hatótávolságú pozíciót rögzítenek. Lényeges, hogy a lekérdezéseket és a kulcsokat módosítja, nem az értékeket.
Stratégiai hatás
Sebesség és méretarány
A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.
Hozzáférés és elérés
Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.
Tisztább döntések
A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.
A Rotary Pozíció beágyazásának jövője
A közelmúltban végzett munkák nagy része arra összpontosít, hogy a kötélt sokkal hosszabb kontextusokra tegyék, mint amennyire a modellt betanították. Az olyan technikák, mint a pozícióinterpoláció, az NTK-tudatos skálázás és a YaRN úgy állítják be a forgási frekvenciákat, hogy egy, mondjuk a 4K tokenekre kiképzett modell enyhe finomhangolással 32K-t vagy többet is képes kezelni. Várhatóan a RoPE marad a domináns pozíciós séma, az alapfrekvenciájának folyamatos finomításával és a millió token kontextusokhoz való skálázásával, valamint a figyelem viselkedésével való kölcsönhatás folyamatos tanulmányozásával.
Valós megvalósítás
A Llama, a Mistral és a Qwen modellek jelzősorrendjének megadása külön pozícióbeágyazás nélkül
A modell használható környezetének kiterjesztése néhány ezerről több tízezer tokenre interpoláció vagy YaRN segítségével
A segítő kódmodellek követik a zárójelek, a függvények és a hivatkozások közötti relatív távolságot a hosszú fájlok között
Támogatja a hosszú dokumentumkérdések megválaszolását, ahol a kérdés és a bizonyítékok közötti relatív helyzet számít
Kockázatok és védőkorlátok
A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.
Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.
Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.
Végrehajtási ütemterv
A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.
Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.
Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.
Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rotary Position Embeddings quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
ALiBi pozíció torzítás
Gyakran ismételt kérdések
What is Rotary Position Embeddings?
A Rotary Position Embedding (RoPE) azt kódolja, ahol az egyes tokenek egy szekvenciában helyezkednek el úgy, hogy a lekérdezést és a kulcsvektorokat a pozícióval arányos szöggel elforgatják. Ez az elegáns trükk lehetővé teszi a transzformátoroknak, hogy megértsék a relatív távolságokat, és kecsesen kiterjesszék a hosszabb környezetekre.
Hogyan fecskendezi be a RoPE a helyzetinformációkat egy transzformátorba?
A RoPE a pozícióval arányos szöggel elforgatja a lekérdezési és kulcsvektorokat, nem pedig külön pozícióvektort.
A figyelemszámítás mely részeit módosítja a RoPE?
A RoPE a lekérdezés és a kulcsvektorok elforgatását alkalmazza, érintetlenül hagyva az értékvektorokat.
Miért forognak a különböző méretpárok különböző frekvencián a kötélben?
Ahogy az óramutatók különböző sebességgel ketyegnek, a különböző frekvenciák lehetővé teszik, hogy egyes párok rövid hatótávolságú sorrendet, mások pedig nagy hatótávolságú pozíciót kódoljanak.
Mi a célja az olyan technikáknak, mint a pozícióinterpoláció, az NTK-tudatos skálázás és a YaRN?
Ezek a módszerek átskálázzák a RoPE forgási frekvenciáit, így a modell sokkal hosszabb összefüggéseket tud kezelni, mint az eredeti képzési hossz.