Roterende posisjoner
Rotary Position Embeddings (RoPE) koder der hvert token sitter i en sekvens ved å rotere spørringen og nøkkelvektorene med en vinkel proporsjonal med posisjonen.
Oversikt
This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.
Dypdykk
Transformatorer har ingen innebygd ordenssans, så de trenger posisjonsinformasjon lagt til på en eller annen måte. Tidlige modeller la til faste sinusformede vektorer eller innlærte posisjonsinnbygginger til inngangene. RoPE, foreslått av Su og kolleger i 2021, tar en annen tilnærming: i stedet for å legge til en posisjonsvektor, roterer den par av dimensjoner i spørringen og nøkkelvektorer med en vinkel som vokser med tokens posisjon. Når modellen beregner punktproduktet mellom en spørring i posisjon m og en nøkkel i posisjon n, fungerer regnestykket slik at resultatet bare avhenger av deres relative avstand m minus n. Dette gir ekte relativ posisjonsbevissthet, spiller godt med effektive oppmerksomhetskjerner og forfaller oppmerksomheten jevnt med avstand. RoPE brukes nå i Llama, Mistral, Qwen og de fleste moderne åpne modeller.
Teknisk innsikt
RoPE behandler innstøpningsdimensjoner i par og bruker en 2D-rotasjon på hvert par, med forskjellige par som roterer ved forskjellige frekvenser, omtrent som viserne til mange klokker som tikker med forskjellige hastigheter. Fordi å rotere etter posisjon m og deretter ta et prikkprodukt med noe rotert etter posisjon n bare etterlater vinkelforskjellen, blir oppmerksomhetspoeng funksjoner av relativ posisjon. Høyfrekvente par fanger opp fin lokal orden; lavfrekvente par fanger langdistanseposisjon. Det er avgjørende at det endrer spørringer og nøkler, ikke verdier.
Strategisk innvirkning
Speed and scale
Språkarbeidsflyter kan bevege seg raskere uten å ofre konsistens.
Access and reach
Det utvider tilgangen på tvers av språk og kommunikasjonsstiler.
Tydeligere avgjørelser
Lag kan bruke mer tid på dømmekraft mens automatisering håndterer repetisjon.
Fremtiden for roterende posisjoner
Mye nyere arbeid fokuserer på å strekke RoPE til sammenhenger langt lenger enn en modell ble trent på. Teknikker som posisjonsinterpolering, NTK-bevisst skalering og YaRN justerer rotasjonsfrekvensene slik at en modell trent på for eksempel 4K-tokens kan håndtere 32K eller mer med lett finjustering. Forvent at RoPE forblir den dominerende posisjonsordningen, med pågående forbedringer av sin basisfrekvens og skalering for million-token-kontekster, og fortsatt studie av hvordan den samhandler med oppmerksomhetsatferd.
Real-World Implementering
Å gi Llama-, Mistral- og Qwen-modellene deres følelse av token-orden uten separate posisjonsinnbygginger
Utvide en modells brukbare kontekst fra noen få tusen til titusenvis av tokens via interpolasjon eller YaRN
Hjelpekodemodeller sporer relative avstander mellom parenteser, funksjoner og referanser på tvers av lange filer
Støtte for svar på langdokumenterte spørsmål der den relative posisjonen mellom spørsmål og bevis betyr noe
Risikoer og rekkverk
Hallusinerte fakta kan stille inn rapporter, støttestrømmer eller forskningsresultater.
Umiddelbar følsomhet kan skape inkonsistente resultater på tvers av lignende forespørsler.
Sensitive tekstdata kan bli eksponert hvis tilgangskontrollene er svake.
Veikart for implementering
Definer utdataformat, tone og kvalitetsstandarder før utrulling.
Bakgrunnssvar med pålitelige kilder når nøyaktighet er viktig.
Hold et sjekkpunkt for menneskelig vurdering for utganger med høy innsats.
Spor feilmønstre og tren opp meldinger eller arbeidsflyter regelmessig.
Fortsett å utforske
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rotary Position Embeddings quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Neste guide
ALiBi posisjonsskjevhet
Ofte stilte spørsmål
What is Rotary Position Embeddings?
Rotary Position Embeddings (RoPE) koder der hvert token sitter i en sekvens ved å rotere spørringen og nøkkelvektorene med en vinkel proporsjonal med posisjonen. Dette elegante trikset lar transformatorer forstå relative avstander og utvide seg elegant til lengre sammenhenger.
Hvordan injiserer RoPE posisjonsinformasjon i en transformator?
RoPE roterer spørrings- og nøkkelvektorer med en vinkel proporsjonal med posisjon, i stedet for å legge til en separat posisjonsvektor.
Hvilke deler av oppmerksomhetsberegningen modifiserer RoPE?
RoPE bruker sine rotasjoner på spørringen og nøkkelvektorene, og lar verdivektorene være urørt.
Hvorfor roterer forskjellige dimensjonspar ved forskjellige frekvenser i RoPE?
Som klokkevisere som tikker med forskjellige hastigheter, lar varierte frekvenser noen par kode kort rekkevidde og andre langdistanseposisjoner.
Hva er målet med teknikker som posisjonsinterpolering, NTK-bevisst skalering og YaRN?
Disse metodene omskalerer RoPEs rotasjonsfrekvenser slik at en modell kan håndtere mye lengre sammenhenger enn den opprinnelige treningslengden.