Мова AI GUIDE

Вбудовування поворотного положення

Rotary Position Embeddings (RoPE) кодує місце розташування кожного маркера в послідовності шляхом повороту його запиту та ключового вектора на кут, пропорційний положенню.

2 хвилини читанняОстаннє оновлення

Огляд

This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.

Глибоке занурення

Трансформери не мають вбудованого почуття порядку, тому їм потрібно якось додати інформацію про положення. У ранніх моделях до вхідних даних додавалися фіксовані синусоїдальні вектори або навчені позиції. RoPE, запропонований Су та його колегами у 2021 році, використовує інший підхід: замість додавання вектора позиції він повертає пари вимірів у запиті та ключові вектори на кут, який зростає разом із позицією токена. Коли модель обчислює скалярний добуток між запитом у позиції m і ключем у позиції n, математика працює таким чином, що результат залежить лише від їх відносної відстані m мінус n. Це дає справжнє усвідомлення відносного положення, добре поєднується з ефективними ядрами уваги та плавно зменшує увагу з відстанню. Зараз RoPE використовується в Llama, Mistral, Qwen і більшості сучасних відкритих моделей.

Технічне розуміння

RoPE обробляє вбудовувані розміри парами та застосовує двовимірне обертання до кожної пари, причому різні пари обертаються з різною частотою, подібно до того, як стрілки багатьох годинників цокають з різною швидкістю. Оскільки обертання на позицію m, а потім скалярний добуток із чимось, повернутим на позицію n, залишає лише кутову різницю, показники уваги стають функціями відносного положення. Високочастотні пари вловлюють тонкий локальний порядок; низькочастотні пари фіксують дальню позицію. Важливо те, що він змінює запити та ключі, а не значення.

Стратегічний вплив

Швидкість і масштаб

Мовні робочі процеси можуть рухатися швидше без шкоди для узгодженості.

Доступ і охоплення

Це розширює доступ до різних мов і стилів спілкування.

Чіткіші рішення

Команди можуть витрачати більше часу на оцінювання, поки автоматизація справляється з повторенням.

Майбутнє вбудованих поворотних позицій

Значна частина останніх робіт зосереджена на розтягуванні RoPE на контексти, набагато довші, ніж модель тренувалась. Такі методи, як інтерполяція позиції, масштабування з урахуванням NTK і YaRN, регулюють частоти обертання, щоб модель, навчена, скажімо, на токенах 4K могла обробляти 32K або більше з легким тонким налаштуванням. Очікуйте, що RoPE залишиться домінуючою позиційною схемою з постійним вдосконаленням її базової частоти та масштабування для контекстів із мільйонами токенів, а також продовженням вивчення того, як вона взаємодіє з поведінкою уваги.

Реалізація в реальному світі

Надання Llama, Mistral і Qwen моделює їх відчуття порядку токенів без окремого вбудовування позицій

Розширення використовуваного контексту моделі з кількох тисяч до десятків тисяч токенів за допомогою інтерполяції або YaRN

Допомога моделям коду відстежувати відносні відстані між дужками, функціями та посиланнями в довгих файлах

Підтримуйте відповіді на питання з довгим документом, де важлива відносна позиція між питанням і доказами

Ризики та огорожі

Галюциновані факти можуть непомітно входити у звіти, допоміжні потоки або результати досліджень.

Делікатність підказок може створити суперечливі результати для подібних запитів.

Конфіденційні текстові дані можуть бути розкриті, якщо контроль доступу слабкий.

Дорожня карта впровадження

1

Визначте вихідний формат, тон і стандарти якості перед розгортанням.

2

Якщо точність має значення, зв’яжіться з надійними джерелами.

3

Тримайте контрольну точку перевірки людьми для отримання високих ставок.

4

Відстежуйте моделі збоїв і регулярно перенавчайте підказки або робочі процеси.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rotary Position Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Зміщення позиції ALiBi

Часті запитання

What is Rotary Position Embeddings?

Rotary Position Embeddings (RoPE) кодує місце розташування кожного маркера в послідовності шляхом повороту його запиту та ключового вектора на кут, пропорційний положенню. Цей елегантний прийом дозволяє трансформаторам розуміти відносні відстані та витончено поширюватися на довші контексти.

Як RoPE вводить інформацію про положення в трансформатор?

RoPE повертає вектор запиту та ключ на кут, пропорційний позиції, а не додає окремий вектор позиції.

Які частини обчислення уваги змінює RoPE?

RoPE застосовує обертання до векторів запиту та ключів, залишаючи вектори значень недоторканими.

Чому різні пари розмірів обертаються з різною частотою в RoPE?

Подібно до стрілок годинника, що цокають з різною швидкістю, різні частоти дозволяють одним парам кодувати порядок на короткій відстані, а інші — на дальній.

Яка мета таких методів, як інтерполяція позиції, масштабування з урахуванням NTK і YaRN?

Ці методи перемасштабують частоти обертання RoPE, щоб модель могла працювати з набагато довшими контекстами, ніж початкова тривалість навчання.