Osadzenia w pozycji obrotowej
Rotary Position Embeddings (RoPE) koduje miejsce, w którym każdy token znajduje się w sekwencji, obracając jego wektory zapytania i klucza o kąt proporcjonalny do położenia.
Przegląd
This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.
Głębokie nurkowanie
Transformatory nie mają wbudowanego poczucia porządku, więc wymagają w jakiś sposób dodania informacji o położeniu. Wczesne modele dodawały do wejść stałe wektory sinusoidalne lub osadzanie wyuczonych pozycji. RoPE, zaproponowane przez Su i współpracowników w 2021 r., przyjmuje inne podejście: zamiast dodawać wektor pozycji, obraca pary wymiarów w zapytaniu i wektory kluczowe o kąt rosnący wraz z pozycją tokena. Kiedy model oblicza iloczyn skalarny między zapytaniem w pozycji m a kluczem w pozycji n, obliczenia matematyczne działają, więc wynik zależy tylko od ich względnej odległości m minus n. Daje to prawdziwą świadomość pozycji względnej, dobrze współpracuje z wydajnymi jądrami uwagi i płynnie zanika uwagę wraz z odległością. RoPE jest obecnie używany w Lamie, Mistralu, Qwen i większości nowoczesnych modelach otwartych.
Wgląd techniczny
RoPE traktuje osadzanie wymiarów w parach i stosuje obrót 2D do każdej pary, przy czym różne pary obracają się z różnymi częstotliwościami, podobnie jak wskazówki wielu zegarów tykają z różnymi prędkościami. Ponieważ obrót o pozycję m, a następnie wzięcie iloczynu skalarnego z czymś obróconym o pozycję n pozostawia jedynie różnicę kątów, wyniki uwagi stają się funkcjami względnego położenia. Pary o wysokiej częstotliwości rejestrują delikatny porządek lokalny; pary o niskiej częstotliwości rejestrują pozycję dalekiego zasięgu. Co najważniejsze, modyfikuje zapytania i klucze, a nie wartości.
Wpływ strategiczny
Szybkość i skala
Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.
Dostęp i zasięg
Rozszerza dostęp w różnych językach i stylach komunikacji.
Jaśniejsze decyzje
Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.
Przyszłość osadzania w pozycji obrotowej
Wiele niedawnych prac koncentruje się na rozciąganiu RoPE na konteksty znacznie dłuższe, niż trenowano model. Techniki takie jak interpolacja pozycji, skalowanie z uwzględnieniem NTK i YaRN dostosowują częstotliwości rotacji, tak aby model wytrenowany na, powiedzmy, tokenach 4K był w stanie obsłużyć 32K lub więcej przy lekkim dostrajaniu. Można się spodziewać, że RoPE pozostanie dominującym schematem pozycyjnym, z ciągłymi udoskonaleniami częstotliwości podstawowej i skalowaniem dla kontekstów zawierających miliony tokenów, a także ciągłymi badaniami nad jego interakcją z zachowaniem uwagi.
Implementacja w świecie rzeczywistym
Nadanie modelom Lamy, Mistrala i Qwen poczucia porządku symbolicznego bez osadzania oddzielnych pozycji
Rozszerzanie kontekstu użytkowego modelu z kilku tysięcy do dziesiątek tysięcy tokenów poprzez interpolację lub YaRN
Pomaganie modelom kodu w śledzeniu względnych odległości między nawiasami, funkcjami i odniesieniami w długich plikach
Wspieranie odpowiedzi na pytania w ramach długiego dokumentu, gdy liczy się względna pozycja między pytaniem a dowodami
Zagrożenia i poręcze
Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.
Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.
Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.
Plan wdrożenia
Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.
Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.
Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.
Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rotary Position Embeddings quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Odchylenie pozycji ALiBi
Często zadawane pytania
What is Rotary Position Embeddings?
Rotary Position Embeddings (RoPE) koduje miejsce, w którym każdy token znajduje się w sekwencji, obracając jego wektory zapytania i klucza o kąt proporcjonalny do położenia. Ta elegancka sztuczka pozwala transformatorom zrozumieć względne odległości i z wdziękiem rozszerzyć się na dłuższe konteksty.
W jaki sposób RoPE wprowadza informacje o położeniu do transformatora?
RoPE obraca wektory zapytań i kluczy o kąt proporcjonalny do położenia, zamiast dodawać oddzielny wektor położenia.
Które części obliczeń uwagi modyfikuje RoPE?
RoPE stosuje swoje rotacje do wektorów zapytania i klucza, pozostawiając wektory wartości nietknięte.
Dlaczego różne pary wymiarów obracają się z różnymi częstotliwościami w RoPE?
Podobnie jak wskazówki zegara tykające z różną szybkością, zróżnicowane częstotliwości pozwalają niektórym parom kodować porządek krótkiego zasięgu, a innym pozycję dalekiego zasięgu.
Jaki jest cel technik takich jak interpolacja pozycji, skalowanie z uwzględnieniem NTK i YaRN?
Metody te przeskalowują częstotliwości rotacji RoPE, dzięki czemu model może obsłużyć znacznie dłuższe konteksty niż pierwotna długość szkolenia.