Språk AI GUIDE

Roterende posisjoner

Rotary Position Embeddings (RoPE) koder der hvert token sitter i en sekvens ved å rotere spørringen og nøkkelvektorene med en vinkel proporsjonal med posisjonen.

2 min lesingSist oppdatert

Oversikt

This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.

Dypdykk

Transformatorer har ingen innebygd ordenssans, så de trenger posisjonsinformasjon lagt til på en eller annen måte. Tidlige modeller la til faste sinusformede vektorer eller innlærte posisjonsinnbygginger til inngangene. RoPE, foreslått av Su og kolleger i 2021, tar en annen tilnærming: i stedet for å legge til en posisjonsvektor, roterer den par av dimensjoner i spørringen og nøkkelvektorer med en vinkel som vokser med tokens posisjon. Når modellen beregner punktproduktet mellom en spørring i posisjon m og en nøkkel i posisjon n, fungerer regnestykket slik at resultatet bare avhenger av deres relative avstand m minus n. Dette gir ekte relativ posisjonsbevissthet, spiller godt med effektive oppmerksomhetskjerner og forfaller oppmerksomheten jevnt med avstand. RoPE brukes nå i Llama, Mistral, Qwen og de fleste moderne åpne modeller.

Teknisk innsikt

RoPE behandler innstøpningsdimensjoner i par og bruker en 2D-rotasjon på hvert par, med forskjellige par som roterer ved forskjellige frekvenser, omtrent som viserne til mange klokker som tikker med forskjellige hastigheter. Fordi å rotere etter posisjon m og deretter ta et prikkprodukt med noe rotert etter posisjon n bare etterlater vinkelforskjellen, blir oppmerksomhetspoeng funksjoner av relativ posisjon. Høyfrekvente par fanger opp fin lokal orden; lavfrekvente par fanger langdistanseposisjon. Det er avgjørende at det endrer spørringer og nøkler, ikke verdier.

Strategisk innvirkning

Speed and scale

Språkarbeidsflyter kan bevege seg raskere uten å ofre konsistens.

Access and reach

Det utvider tilgangen på tvers av språk og kommunikasjonsstiler.

Tydeligere avgjørelser

Lag kan bruke mer tid på dømmekraft mens automatisering håndterer repetisjon.

Fremtiden for roterende posisjoner

Mye nyere arbeid fokuserer på å strekke RoPE til sammenhenger langt lenger enn en modell ble trent på. Teknikker som posisjonsinterpolering, NTK-bevisst skalering og YaRN justerer rotasjonsfrekvensene slik at en modell trent på for eksempel 4K-tokens kan håndtere 32K eller mer med lett finjustering. Forvent at RoPE forblir den dominerende posisjonsordningen, med pågående forbedringer av sin basisfrekvens og skalering for million-token-kontekster, og fortsatt studie av hvordan den samhandler med oppmerksomhetsatferd.

Real-World Implementering

Å gi Llama-, Mistral- og Qwen-modellene deres følelse av token-orden uten separate posisjonsinnbygginger

Utvide en modells brukbare kontekst fra noen få tusen til titusenvis av tokens via interpolasjon eller YaRN

Hjelpekodemodeller sporer relative avstander mellom parenteser, funksjoner og referanser på tvers av lange filer

Støtte for svar på langdokumenterte spørsmål der den relative posisjonen mellom spørsmål og bevis betyr noe

Risikoer og rekkverk

Hallusinerte fakta kan stille inn rapporter, støttestrømmer eller forskningsresultater.

Umiddelbar følsomhet kan skape inkonsistente resultater på tvers av lignende forespørsler.

Sensitive tekstdata kan bli eksponert hvis tilgangskontrollene er svake.

Veikart for implementering

1

Definer utdataformat, tone og kvalitetsstandarder før utrulling.

2

Bakgrunnssvar med pålitelige kilder når nøyaktighet er viktig.

3

Hold et sjekkpunkt for menneskelig vurdering for utganger med høy innsats.

4

Spor feilmønstre og tren opp meldinger eller arbeidsflyter regelmessig.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rotary Position Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

ALiBi posisjonsskjevhet

Ofte stilte spørsmål

What is Rotary Position Embeddings?

Rotary Position Embeddings (RoPE) koder der hvert token sitter i en sekvens ved å rotere spørringen og nøkkelvektorene med en vinkel proporsjonal med posisjonen. Dette elegante trikset lar transformatorer forstå relative avstander og utvide seg elegant til lengre sammenhenger.

Hvordan injiserer RoPE posisjonsinformasjon i en transformator?

RoPE roterer spørrings- og nøkkelvektorer med en vinkel proporsjonal med posisjon, i stedet for å legge til en separat posisjonsvektor.

Hvilke deler av oppmerksomhetsberegningen modifiserer RoPE?

RoPE bruker sine rotasjoner på spørringen og nøkkelvektorene, og lar verdivektorene være urørt.

Hvorfor roterer forskjellige dimensjonspar ved forskjellige frekvenser i RoPE?

Som klokkevisere som tikker med forskjellige hastigheter, lar varierte frekvenser noen par kode kort rekkevidde og andre langdistanseposisjoner.

Hva er målet med teknikker som posisjonsinterpolering, NTK-bevisst skalering og YaRN?

Disse metodene omskalerer RoPEs rotasjonsfrekvenser slik at en modell kan håndtere mye lengre sammenhenger enn den opprinnelige treningslengden.