Incorporamenti di posizioni rotanti
I Rotary Position Embedding (RoPE) codificano il punto in cui ciascun token si trova in una sequenza ruotando la query e i vettori chiave di un angolo proporzionale alla posizione.
Panoramica
This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.
Immersione profonda
I trasformatori non hanno un senso dell'ordine innato, quindi hanno bisogno che le informazioni sulla posizione vengano aggiunte in qualche modo. I primi modelli aggiungevano vettori sinusoidali fissi o incorporamenti di posizioni apprese agli input. RoPE, proposto da Su e colleghi nel 2021, adotta un approccio diverso: invece di aggiungere un vettore di posizione, ruota coppie di dimensioni nella query e nei vettori chiave di un angolo che cresce con la posizione del token. Quando il modello calcola il prodotto scalare tra una query nella posizione m e una chiave nella posizione n, i calcoli funzionano in modo che il risultato dipenda solo dalla loro distanza relativa m meno n. Ciò fornisce una reale consapevolezza della posizione relativa, funziona bene con nuclei di attenzione efficienti e diminuisce gradualmente l'attenzione con la distanza. RoPE è ora utilizzato in Llama, Mistral, Qwen e nella maggior parte dei modelli aperti moderni.
Approfondimento tecnico
RoPE tratta le dimensioni di incorporamento in coppie e applica una rotazione 2D a ciascuna coppia, con coppie diverse che ruotano a frequenze diverse, proprio come le lancette di molti orologi che ticchettano a velocità diverse. Poiché ruotare per la posizione m e poi prendere un prodotto scalare con qualcosa ruotato per la posizione n lascia solo la differenza angolare, i punteggi di attenzione diventano funzioni della posizione relativa. Le coppie ad alta frequenza catturano un buon ordine locale; le coppie a bassa frequenza catturano la posizione a lungo raggio. Fondamentalmente, modifica query e chiavi, non valori.
Impatto strategico
Velocità e scala
I flussi di lavoro linguistici possono muoversi più velocemente senza sacrificare la coerenza.
Accedere e raggiungere
Espande l'accesso attraverso lingue e stili di comunicazione.
Decisioni più chiare
I team possono dedicare più tempo al giudizio mentre l'automazione gestisce la ripetizione.
Il futuro dell’inclusione delle posizioni nel Rotary
Molti lavori recenti si concentrano sull’estensione del RoPE a contesti molto più lunghi di quelli su cui è stato addestrato un modello. Tecniche come l'interpolazione della posizione, il ridimensionamento compatibile con NTK e YaRN regolano le frequenze di rotazione in modo che un modello addestrato, ad esempio, su token 4K possa gestire 32K o più con una leggera regolazione fine. Aspettatevi che RoPE rimanga lo schema posizionale dominante, con continui perfezionamenti alla sua frequenza di base e ridimensionamento per contesti da milioni di token, e uno studio continuo su come interagisce con il comportamento di attenzione.
Implementazione nel mondo reale
Dare a Llama, Mistral e Qwen modella il loro senso dell'ordine simbolico senza incorporamenti di posizioni separate
Estendere il contesto utilizzabile di un modello da poche migliaia a decine di migliaia di token tramite interpolazione o YaRN
Aiutare i modelli di codice a tenere traccia delle distanze relative tra parentesi, funzioni e riferimenti in file lunghi
Supportare la risposta a domande su documenti lunghi laddove la posizione relativa tra domanda e prova è importante
Rischi e guardrail
Fatti allucinati possono tranquillamente entrare nei rapporti, nei flussi di supporto o nei risultati della ricerca.
La sensibilità tempestiva può creare risultati incoerenti tra richieste simili.
I dati di testo sensibili potrebbero essere esposti se i controlli di accesso sono deboli.
Tabella di marcia per l'implementazione
Definisci il formato di output, il tono e gli standard di qualità prima dell'implementazione.
Risposte concrete con fonti attendibili ogni volta che la precisione è importante.
Mantenere un checkpoint di revisione umana per i risultati ad alto rischio.
Tieni traccia dei modelli di errore e riqualifica regolarmente le richieste o i flussi di lavoro.
Continua a esplorare
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rotary Position Embeddings quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Prossima guida
Bias di posizione ALiBi
Domande frequenti
What is Rotary Position Embeddings?
I Rotary Position Embedding (RoPE) codificano il punto in cui ciascun token si trova in una sequenza ruotando la query e i vettori chiave di un angolo proporzionale alla posizione. Questo elegante trucco consente ai trasformatori di comprendere le distanze relative e di estendersi con grazia a contesti più lunghi.
In che modo RoPE inserisce le informazioni sulla posizione in un trasformatore?
RoPE ruota i vettori di query e chiave di un angolo proporzionale alla posizione, anziché aggiungere un vettore di posizione separato.
Quali parti del calcolo dell’attenzione modifica RoPE?
RoPE applica le sue rotazioni alla query e ai vettori chiave, lasciando intatti i vettori dei valori.
Perché coppie di dimensioni diverse ruotano a frequenze diverse in RoPE?
Come le lancette di un orologio che ticchettano a velocità diverse, le frequenze diverse consentono ad alcune coppie di codificare un ordine a corto raggio e ad altre una posizione a lungo raggio.
Qual è l'obiettivo di tecniche come l'interpolazione della posizione, il ridimensionamento basato su NTK e YaRN?
Questi metodi ridimensionano le frequenze di rotazione di RoPE in modo che un modello possa gestire contesti molto più lunghi rispetto alla durata di addestramento originale.