Технічний КЕРІВНИЦТВО

YaRN і розширення довжини контексту

YaRN (Yet another RoPE extensioN) — це ефективна техніка для розтягування придатного для використання контекстного вікна моделі далеко за межі того, на чому її навчали.

2 хвилини читанняОстаннє оновлення

Огляд

It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.

Глибоке занурення

Більшість сучасних LLM кодують позиції токенів за допомогою RoPE (Rotary Position Embeddings), які повертають вектори запиту та ключа на кути, прив’язані до позиції. Коли ви подаєте послідовності, довші за тривалість тренування, ці обертання потрапляють у невидимі діапазони, і модель руйнується. YaRN, представлений у 2023 році Боуеном Пенгом і його колегами, виправляє це за допомогою інтерполяції з урахуванням NTK, застосованої до частоти: він залишає високочастотні параметри (які фіксують локальні зв’язки на короткій відстані) здебільшого недоторканими, тоді як інтерполює низькочастотні розміри (які відстежують позицію на великій відстані). YaRN також додає коригування температури до уваги, щоб протидіяти змінам ентропії, які походять від довших контекстів. Результатом є висока продуктивність у довгому контексті після тонкого налаштування лише невеликої частини даних і кроків, які вимагають наївні підходи.

Технічне розуміння

RoPE призначає кожному розміру вбудовування частоту обертання. Наївна лінійна інтерполяція однаково стискає всі частоти, завдаючи шкоди високочастотним розмірам, які кодують дрібні локальні деталі. YaRN використовує функцію зміни розмірів, щоб інтерполювати лише низькочастотні (довгохвильові) розміри, зберігаючи високочастотні, а також масштабування температури уваги 1/sqrt(t), що підтримує стабільність м’якої максимальної різкості зі збільшенням довжини послідовності. Цей поетапний підхід NTK розширює контекст із значно меншою деградацією.

Стратегічний вплив

Вартість і бюджет

Архітектурні рішення збільшують продуктивність і експлуатаційні витрати протягом багатьох років.

Чіткіші рішення

Технічна освіта допомагає командам вибрати правильний стек, а не лише найновіший.

Контроль якості

Кращий інженерний вибір зменшує проблеми з надійністю у виробництві.

Майбутнє YaRN і розширення довжини контексту

Розширення контексту тепер є стандартною практикою: відкриті моделі регулярно надсилають розширені варіанти YaRN, які досягають 128 тис. токенів або більше. Дослідження рухаються до методів, які розширюють контекст із нульовим або майже нульовим тонким налаштуванням, поєднують масштабування RoPE із трюками шаблону уваги та зберігають якість у всьому вікні, а не лише в кінцях. Очікуйте тіснішої інтеграції цих методів у попереднє навчання, тому довгий контекст є рідним, а не модернізованим.

Реалізація в реальному світі

Розширення моделі відкритого 4K-контексту до 32K або 128K для відповідей на запитання у довгому документі з коротким налаштуванням

Дозволяє пошуково-доповненим системам приймати багато об’єднаних уривків без скорочення

Активація помічників коду, яким потрібен цілий великий файл сховища або кілька файлів в одному запиті

Адаптація базової моделі для довгих багаточергових розмов, які накопичують велику історію чатів

Ризики та огорожі

Оптимізація одного тесту може приховати ширші слабкі сторони системи.

Витрати на інфраструктуру та обслуговування часто недооцінюються.

Прогалини в безпеці та спостережуваності можуть зростати в міру ускладнення систем.

Дорожня карта впровадження

1

Визначте цільові показники затримки, якості та вартості перед впровадженням.

2

Тест за реалістичних умов навантаження та даних.

3

Моніторинг інструментів на наявність помилок, дрейфу та впливу користувача.

4

Перед масштабуванням підготуйте шляхи відкату та реагування на інциденти.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN and Context Length Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Інтерполяція позиції для розширення контексту

Часті запитання

What is YaRN and Context Length Extension?

YaRN (Yet another RoPE extensioN) — це ефективна техніка для розтягування придатного для використання контекстного вікна моделі далеко за межі того, на чому її навчали. Він вміло масштабує вбудовані поворотні позиції, щоб модель, навчена, скажімо, на токенах 4K, могла обробляти 32K або більше з мінімальним тонким налаштуванням.

Який метод позиційного кодування змінює YaRN для розширення контексту?

YaRN, чия назва означає Yet another RoPE extensioN, змінює масштаб вбудованих позицій обертання, які використовуються в більшості сучасних LLM.

Що йде не так, коли модель RoPE бачить послідовності, довші за тривалість навчання?

Позиції поза тренуваннями створюють кути обертання, яких модель ніколи не бачила, тому поведінка уваги різко погіршується.

Як YaRN обробляє різні параметри частоти RoPE?

YaRN використовує поетапне змінення NTK, яке інтерполює довгохвильові низькочастотні затемнення та залишає майже недоторканими високочастотні затемнення короткого діапазону.

Яке додаткове коригування застосовує YaRN, окрім зміни масштабу частот?

YaRN додає температурне масштабування до логітів уваги, щоб протидіяти ентропійним зсувам, які відбуваються в міру зростання контексту.

Яка ключова практична перевага YaRN перед простою інтерполяцією?

YaRN досягає високої якості довгого контексту після тонкого налаштування невеликої частини даних, які вимагають наївні методи.