Език AI РЪКОВОДСТВО

Вграждане на ротационна позиция

Rotary Position Embeddings (RoPE) кодират къде се намира всеки токен в последователност чрез завъртане на неговата заявка и ключови вектори под ъгъл, пропорционален на позицията.

2 min readПоследна актуализация

Преглед

This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.

Дълбоко гмуркане

Трансформаторите нямат вградено чувство за ред, така че се нуждаят от информация за позицията, добавена по някакъв начин. Ранните модели добавяха към входовете фиксирани синусоидални вектори или вграждане на научени позиции. RoPE, предложен от Su и колеги през 2021 г., използва различен подход: вместо да добавя вектор на позиция, той завърта двойки измерения в заявката и ключови вектори под ъгъл, който расте с позицията на токена. Когато моделът изчислява точковото произведение между заявка на позиция m и ключ на позиция n, математиката работи така, че резултатът зависи само от тяхното относително разстояние m минус n. Това дава истинска осведоменост за относителната позиция, играе добре с ефективни ядра за внимание и намалява вниманието плавно с разстоянието. RoPE вече се използва в Llama, Mistral, Qwen и повечето модерни отворени модели.

Техническа информация

RoPE третира размерите на вграждане по двойки и прилага 2D ротация към всяка двойка, като различните двойки се въртят на различни честоти, подобно на стрелките на много часовници, тиктакащи с различни скорости. Тъй като завъртането по позиция m и след това вземането на точков продукт с нещо, завъртяно по позиция n, оставя само ъгловата разлика, оценките за внимание стават функции на относителната позиция. Високочестотните двойки улавят фин локален ред; нискочестотни двойки улавят позиция на дълги разстояния. Най-важното е, че той променя заявки и ключове, а не стойности.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на вградените ротационни позиции

Голяма част от скорошната работа се фокусира върху разтягане на RoPE в контексти, много по-дълги от тези, върху които е бил обучен моделът. Техники като интерполация на позиция, NTK-съобразено мащабиране и YaRN коригират честотите на въртене, така че модел, обучен на, да речем, 4K токени, може да се справи с 32K или повече с лека фина настройка. Очаквайте RoPE да остане доминиращата позиционна схема, с продължаващи усъвършенствания на нейната базова честота и мащабиране за контексти с милиони токени, и продължаващо проучване на това как тя взаимодейства с поведението на вниманието.

Внедряване в реалния свят

Предоставянето на Llama, Mistral и Qwen моделира тяхното усещане за ред на токени без отделни вграждания на позиции

Разширяване на използваем контекст на модел от няколко хиляди до десетки хиляди токени чрез интерполация или YaRN

Подпомагане на кодовите модели да проследяват относителните разстояния между скоби, функции и препратки в дълги файлове

Подкрепа за отговор на въпроси с дълъг документ, когато относителната позиция между въпрос и доказателства има значение

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rotary Position Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Отклонение на позицията на ALiBi

Frequently asked questions

What is Rotary Position Embeddings?

Rotary Position Embeddings (RoPE) кодират къде се намира всеки токен в последователност чрез завъртане на неговата заявка и ключови вектори под ъгъл, пропорционален на позицията. Този елегантен трик позволява на трансформаторите да разберат относителните разстояния и да се разширят елегантно към по-дълги контексти.

Как RoPE инжектира информация за позицията в трансформатор?

RoPE завърта заявка и ключови вектори на ъгъл, пропорционален на позицията, вместо да добавя отделен вектор на позиция.

Кои части от изчислението на вниманието променя RoPE?

RoPE прилага ротациите си към заявката и ключовите вектори, оставяйки стойностните вектори недокоснати.

Защо различните двойки измерения се въртят на различни честоти в RoPE?

Подобно на стрелките на часовника, тиктакащи с различна скорост, разнообразните честоти позволяват на някои двойки да кодират реда на къси разстояния, а на други - позиции на далечни разстояния.

Каква е целта на техники като интерполация на позиция, NTK-aware мащабиране и YaRN?

Тези методи променят мащаба на честотите на въртене на RoPE, така че моделът да може да се справи с много по-дълги контексти от първоначалната продължителност на обучението.