Taal AI-GIDS

Inbedding van roterende posities

Rotary Position Embeddings (RoPE) coderen waar elk token zich in een reeks bevindt door de query- en sleutelvectoren te roteren met een hoek die evenredig is aan de positie.

2 min readLaatst bijgewerkt

Overzicht

This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.

Diepe duik

Transformers hebben geen ingebouwd gevoel voor orde, dus moeten ze op de een of andere manier positie-informatie toevoegen. Vroege modellen voegden vaste sinusoïdale vectoren of geleerde positie-inbedding toe aan de ingangen. RoPE, voorgesteld door Su en collega's in 2021, hanteert een andere aanpak: in plaats van een positievector toe te voegen, roteert het paren dimensies in de query en sleutelvectoren met een hoek die meegroeit met de positie van het token. Wanneer het model het puntproduct berekent tussen een vraag op positie m en een sleutel op positie n, komt de berekening zo uit dat het resultaat alleen afhangt van hun relatieve afstand m min n. Dit zorgt voor een echt bewustzijn van de relatieve positie, speelt mooi samen met efficiënte aandachtskernen en laat de aandacht soepel verdwijnen naarmate de afstand groter wordt. RoPE wordt nu gebruikt in Llama, Mistral, Qwen en de meeste moderne open modellen.

Technisch inzicht

RoPE behandelt het inbedden van dimensies in paren en past een 2D-rotatie toe op elk paar, waarbij verschillende paren op verschillende frequenties roteren, net zoals de wijzers van veel klokken met verschillende snelheden tikken. Omdat het roteren op positie m en vervolgens een puntproduct neemt met iets dat op positie n is geroteerd, alleen het hoekverschil overblijft, worden aandachtsscores functies van de relatieve positie. Hoogfrequente paren leggen de fijne lokale orde vast; laagfrequente paren leggen posities op lange afstand vast. Cruciaal is dat het query's en sleutels wijzigt, en niet de waarden.

Strategische impact

Speed and scale

Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.

Access and reach

Het breidt de toegang uit naar meerdere talen en communicatiestijlen.

Clearer decisions

Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.

De toekomst van roterende positie-inbedding

Veel recent werk richt zich op het uitbreiden van RoPE naar contexten die veel langer duren dan waarop een model is getraind. Technieken zoals positie-interpolatie, NTK-bewuste schaling en YaRN passen de rotatiefrequenties aan, zodat een model dat is getraind op bijvoorbeeld 4K-tokens 32K of meer aankan met lichte fijnafstemming. Verwacht dat RoPE het dominante positionele schema zal blijven, met voortdurende verfijningen van de basisfrequentie en schaalvergroting voor contexten van miljoenen tokens, en voortgezet onderzoek naar hoe het samenwerkt met aandachtsgedrag.

Implementatie in de echte wereld

Door Llama-, Mistral- en Qwen-modellen hun gevoel van symbolische volgorde te geven zonder afzonderlijke positie-inbedding

De bruikbare context van een model uitbreiden van een paar duizend naar tienduizenden tokens via interpolatie of YaRN

Helpt codemodellen bij het bijhouden van de relatieve afstanden tussen haakjes, functies en verwijzingen in lange bestanden

Ondersteuning van het beantwoorden van vragen uit lange documenten waarbij de relatieve positie tussen vraag en bewijs van belang is

Risico's en vangrails

Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.

Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.

Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.

Implementatie routekaart

1

Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.

2

Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.

3

Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.

4

Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rotary Position Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

ALiBi-positiebias

Frequently asked questions

What is Rotary Position Embeddings?

Rotary Position Embeddings (RoPE) coderen waar elk token zich in een reeks bevindt door de query- en sleutelvectoren te roteren met een hoek die evenredig is aan de positie. Met deze elegante truc kunnen transformatoren relatieve afstanden begrijpen en zich op elegante wijze uitbreiden naar langere contexten.

Hoe injecteert RoPE positie-informatie in een transformator?

RoPE roteert query- en sleutelvectoren over een hoek die evenredig is met de positie, in plaats van een afzonderlijke positievector toe te voegen.

Welke delen van de aandachtsberekening wijzigt RoPE?

RoPE past zijn rotaties toe op de query- en sleutelvectoren, waarbij de waardevectoren onaangeroerd blijven.

Waarom roteren verschillende dimensieparen op verschillende frequenties in RoPE?

Net als wijzers die met verschillende snelheden tikken, zorgen gevarieerde frequenties ervoor dat sommige paren de korteafstandsvolgorde coderen en andere de langeafstandspositie.

Wat is het doel van technieken als positie-interpolatie, NTK-aware schaling en YaRN?

Deze methoden herschalen de rotatiefrequenties van RoPE, zodat een model veel langere contexten aankan dan de oorspronkelijke trainingsduur.