PRZEWODNIK Językowy AI

Osadzenia w pozycji obrotowej

Rotary Position Embeddings (RoPE) koduje miejsce, w którym każdy token znajduje się w sekwencji, obracając jego wektory zapytania i klucza o kąt proporcjonalny do położenia.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.

Głębokie nurkowanie

Transformatory nie mają wbudowanego poczucia porządku, więc wymagają w jakiś sposób dodania informacji o położeniu. Wczesne modele dodawały do ​​wejść stałe wektory sinusoidalne lub osadzanie wyuczonych pozycji. RoPE, zaproponowane przez Su i współpracowników w 2021 r., przyjmuje inne podejście: zamiast dodawać wektor pozycji, obraca pary wymiarów w zapytaniu i wektory kluczowe o kąt rosnący wraz z pozycją tokena. Kiedy model oblicza iloczyn skalarny między zapytaniem w pozycji m a kluczem w pozycji n, obliczenia matematyczne działają, więc wynik zależy tylko od ich względnej odległości m minus n. Daje to prawdziwą świadomość pozycji względnej, dobrze współpracuje z wydajnymi jądrami uwagi i płynnie zanika uwagę wraz z odległością. RoPE jest obecnie używany w Lamie, Mistralu, Qwen i większości nowoczesnych modelach otwartych.

Wgląd techniczny

RoPE traktuje osadzanie wymiarów w parach i stosuje obrót 2D do każdej pary, przy czym różne pary obracają się z różnymi częstotliwościami, podobnie jak wskazówki wielu zegarów tykają z różnymi prędkościami. Ponieważ obrót o pozycję m, a następnie wzięcie iloczynu skalarnego z czymś obróconym o pozycję n pozostawia jedynie różnicę kątów, wyniki uwagi stają się funkcjami względnego położenia. Pary o wysokiej częstotliwości rejestrują delikatny porządek lokalny; pary o niskiej częstotliwości rejestrują pozycję dalekiego zasięgu. Co najważniejsze, modyfikuje zapytania i klucze, a nie wartości.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość osadzania w pozycji obrotowej

Wiele niedawnych prac koncentruje się na rozciąganiu RoPE na konteksty znacznie dłuższe, niż trenowano model. Techniki takie jak interpolacja pozycji, skalowanie z uwzględnieniem NTK i YaRN dostosowują częstotliwości rotacji, tak aby model wytrenowany na, powiedzmy, tokenach 4K był w stanie obsłużyć 32K lub więcej przy lekkim dostrajaniu. Można się spodziewać, że RoPE pozostanie dominującym schematem pozycyjnym, z ciągłymi udoskonaleniami częstotliwości podstawowej i skalowaniem dla kontekstów zawierających miliony tokenów, a także ciągłymi badaniami nad jego interakcją z zachowaniem uwagi.

Implementacja w świecie rzeczywistym

Nadanie modelom Lamy, Mistrala i Qwen poczucia porządku symbolicznego bez osadzania oddzielnych pozycji

Rozszerzanie kontekstu użytkowego modelu z kilku tysięcy do dziesiątek tysięcy tokenów poprzez interpolację lub YaRN

Pomaganie modelom kodu w śledzeniu względnych odległości między nawiasami, funkcjami i odniesieniami w długich plikach

Wspieranie odpowiedzi na pytania w ramach długiego dokumentu, gdy liczy się względna pozycja między pytaniem a dowodami

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rotary Position Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Odchylenie pozycji ALiBi

Często zadawane pytania

What is Rotary Position Embeddings?

Rotary Position Embeddings (RoPE) koduje miejsce, w którym każdy token znajduje się w sekwencji, obracając jego wektory zapytania i klucza o kąt proporcjonalny do położenia. Ta elegancka sztuczka pozwala transformatorom zrozumieć względne odległości i z wdziękiem rozszerzyć się na dłuższe konteksty.

W jaki sposób RoPE wprowadza informacje o położeniu do transformatora?

RoPE obraca wektory zapytań i kluczy o kąt proporcjonalny do położenia, zamiast dodawać oddzielny wektor położenia.

Które części obliczeń uwagi modyfikuje RoPE?

RoPE stosuje swoje rotacje do wektorów zapytania i klucza, pozostawiając wektory wartości nietknięte.

Dlaczego różne pary wymiarów obracają się z różnymi częstotliwościami w RoPE?

Podobnie jak wskazówki zegara tykające z różną szybkością, zróżnicowane częstotliwości pozwalają niektórym parom kodować porządek krótkiego zasięgu, a innym pozycję dalekiego zasięgu.

Jaki jest cel technik takich jak interpolacja pozycji, skalowanie z uwzględnieniem NTK i YaRN?

Metody te przeskalowują częstotliwości rotacji RoPE, dzięki czemu model może obsłużyć znacznie dłuższe konteksty niż pierwotna długość szkolenia.