GHID AI limbaj

Înglobare de poziție rotativă

Rotary Position Embeddings (RoPE) codifică locul în care fiecare jeton se află într-o secvență, rotind interogarea și vectorii cheie cu un unghi proporțional cu poziția.

2 minute de lecturăUltima actualizare

Prezentare generală

This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.

Scufundare în profunzime

Transformatoarele nu au un sens al ordinii încorporat, așa că au nevoie de informații despre poziție adăugate cumva. Modelele timpurii au adăugat vectori sinusoidali fix sau încorporare de poziții învățate la intrări. RoPE, propus de Su și colegi în 2021, adoptă o abordare diferită: în loc să adauge un vector de poziție, rotește perechi de dimensiuni în interogare și vectori cheie cu un unghi care crește odată cu poziția jetonului. Când modelul calculează produsul punctual dintre o interogare la poziția m și o cheie la poziția n, calculul funcționează astfel încât rezultatul depinde doar de distanța lor relativă m minus n. Acest lucru oferă o conștientizare reală a poziției relative, se joacă frumos cu nucleele de atenție eficiente și diminuează atenția fără probleme cu distanța. RoPE este folosit acum în Llama, Mistral, Qwen și majoritatea modelelor deschise moderne.

Perspectivă tehnică

RoPE tratează dimensiunile de încorporare în perechi și aplică o rotație 2D fiecărei perechi, cu diferite perechi care se rotesc la frecvențe diferite, la fel ca aceia multor ceasuri care ticează la viteze diferite. Deoarece rotirea cu poziția m și apoi luarea unui produs punctual cu ceva rotit de poziția n lasă doar diferența de unghi, scorurile de atenție devin funcții ale poziției relative. Perechile de înaltă frecvență captează ordine locală fină; perechile de joasă frecvență captează poziția pe distanță lungă. În mod crucial, modifică interogările și cheile, nu valorile.

Impact strategic

Viteză și scară

Fluxurile de lucru lingvistice se pot deplasa mai rapid fără a sacrifica consistența.

Acces și acoperire

Extinde accesul în diferite limbi și stiluri de comunicare.

Decizii mai clare

Echipele pot petrece mai mult timp jucând în timp ce automatizarea se ocupă de repetiție.

Viitorul înglobărilor de poziție rotativă

Multe lucrări recente se concentrează pe extinderea RoPE în contexte mult mai lungi decât a fost antrenat un model. Tehnici precum interpolarea poziției, scalarea conștientă de NTK și YaRN ajustează frecvențele de rotație, astfel încât un model antrenat pe, de exemplu, jetoane 4K să poată gestiona 32K sau mai mult cu reglaj fin. Așteptați-vă ca RoPE să rămână schema pozițională dominantă, cu perfecționări continue ale frecvenței sale de bază și scalare pentru contexte de milioane de jetoane și studiere continuă a modului în care interacționează cu comportamentul atenției.

Implementare în lumea reală

Oferându-le modelelor Llama, Mistral și Qwen simțul ordinii de simboluri fără încorporare de poziții separate

Extinderea contextului utilizabil al unui model de la câteva mii la zeci de mii de jetoane prin interpolare sau YaRN

Ajutând modelele de cod să urmărească distanțele relative dintre paranteze, funcții și referințe în fișiere lungi

Sprijinirea răspunsurilor la întrebări cu documente lungi acolo unde poziția relativă între întrebare și dovezi contează

Riscuri și balustrade

Faptele halucinate pot intra în liniște în rapoarte, fluxuri de sprijin sau rezultate ale cercetării.

Sensibilitatea promptă poate crea rezultate inconsecvente pentru solicitări similare.

Datele text sensibile pot fi expuse dacă controalele de acces sunt slabe.

Foaia de parcurs de implementare

1

Definiți formatul de ieșire, tonul și standardele de calitate înainte de lansare.

2

Răspunsurile la sol cu ​​surse de încredere ori de câte ori acuratețea contează.

3

Păstrați un punct de control uman pentru rezultate cu mize mari.

4

Urmăriți tiparele de eșec și reantrenați în mod regulat solicitările sau fluxurile de lucru.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rotary Position Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Prejudecăți de poziție ALiBi

Întrebări frecvente

What is Rotary Position Embeddings?

Rotary Position Embeddings (RoPE) codifică locul în care fiecare jeton se află într-o secvență, rotind interogarea și vectorii cheie cu un unghi proporțional cu poziția. Acest truc elegant le permite transformatorilor să înțeleagă distanțele relative și să se extindă cu grație la contexte mai lungi.

Cum injectează RoPE informații despre poziție într-un transformator?

RoPE rotește vectorii de interogare și cheie cu un unghi proporțional cu poziția, în loc să adauge un vector de poziție separat.

Ce părți ale calculului atenției modifică RoPE?

RoPE își aplică rotațiile vectorilor de interogare și cheie, lăsând vectorii de valoare neatinsi.

De ce perechile de dimensiuni diferite se rotesc la frecvențe diferite în RoPE?

Asemenea acelor ceasului care ticează la viteze diferite, frecvențele variate permit unor perechi să codifice ordinea pe distanță scurtă, iar altele pe poziția pe distanță lungă.

Care este scopul tehnicilor precum interpolarea poziției, scalarea conștientă de NTK și YaRN?

Aceste metode redimensionează frecvențele de rotație ale RoPE, astfel încât un model să poată face față unor contexte mult mai lungi decât durata inițială de antrenament.