Масштабирование контекстного окна YaRN
YaRN (Еще одно расширение RoPE) — это метод, который расширяет полезное контекстное окно преобразователя далеко за пределы того, на чем он был обучен, с минимальной тонкой настройкой.
Обзор
It matters because it lets existing models handle much longer documents without retraining from scratch.
Глубокое погружение
Большинство современных LLM кодируют позиции слов с помощью Rotary Position Embeddings (RoPE), которые хорошо работают только до той длины, которую модель видела во время обучения. Если подать более длинную последовательность, модель сильно ухудшится. YaRN решает эту проблему, изменяя масштаб частоты вращения RoPE с учетом частоты: высокочастотные измерения (которые фиксируют локальные, близлежащие отношения) остаются в основном нетронутыми, а низкочастотные измерения (которые фиксируют положение на большом расстоянии) интерполируются. Он также добавляет регулировку температуры, чтобы обеспечить хорошее поведение логитов на больших расстояниях. Результат, продемонстрированный на моделях LLaMA, расширяет контекст с 4 КБ до 64–128 КБ токенов, используя всего около 0,1% исходных обучающих данных и несколько сотен шагов тонкой настройки.
Техническая информация
RoPE вращает векторы запросов и ключей на угол, пропорциональный положению и частоте каждого измерения. Наивная линейная интерполяция (интерполяция позиции) одинаково сжимает все частоты, нанося вред локальным деталям. Вместо этого YaRN применяет «NTK-по частям»: он интерполирует только низкочастотные (длинноволновые) измерения, оставляет высокочастотные измерения в покое и плавно перемещается между ними. Масштабирование температуры внимания компенсирует сдвиг энтропии, сохраняя точность на больших длинах.
Стратегическое воздействие
Скорость и масштаб
Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.
Доступ и охват
Это расширяет доступ к различным языкам и стилям общения.
Более четкие решения
Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.
Будущее масштабирования контекстного окна YaRN
Расширение с учетом частоты в стиле YaRN стало стандартным компонентом для создания моделей с длинным контекстом; варианты и преемники продолжают появляться по мере того, как лаборатории стремятся к окнам с миллионом токенов. Ожидайте более тесной интеграции с эффективным вниманием, сжатием KV-кэша и динамическим масштабированием, которое настраивается «на лету» в соответствии с запросом. Более широкая тенденция заключается в отделении того, «как долго модель обучалась» от того, «как долго она может с пользой читаться», делая длинный контекст дешевой функцией после обучения, а не дорогостоящим архитектурным обязательством.
Реальная реализация
Расширение открытой модели LLaMA с 4 КБ до 128 000 токенов, чтобы она могла принимать всю кодовую базу или длинный контракт за один проход.
Разрешение чат-боту сохранять очень длинные истории разговоров без обрезки предыдущих ходов.
Обобщение документов размером с книгу или многочасовых стенограмм, которые выходят за пределы собственного окна базовой модели.
Дешевая адаптация предварительно обученной модели для задач извлечения данных с длинным контекстом с использованием лишь небольшого прогона тонкой настройки.
Риски и ограничения
Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.
Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.
Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.
Дорожная карта реализации
Перед развертыванием определите выходной формат, тон и стандарты качества.
Наземные ответы с помощью надежных источников, когда точность имеет значение.
Обеспечьте контрольную точку человеческого контроля для получения важных результатов.
Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN Context Window Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Контекстные окна
Часто задаваемые вопросы
What is YaRN Context Window Scaling?
YaRN (Еще одно расширение RoPE) — это метод, который расширяет полезное контекстное окно преобразователя далеко за пределы того, на чем он был обучен, с минимальной тонкой настройкой. Это важно, поскольку позволяет существующим моделям обрабатывать гораздо более длинные документы без необходимости переобучения с нуля.
Какую схему кодирования позиции изменяет YaRN для увеличения длины контекста?
YaRN означает «Еще одно расширение RoPE» и работает путем изменения масштаба частот вращения, используемых в встраиваниях вращающихся позиций.
Как YaRN относится к высокочастотным и низкочастотным измерениям RoPE?
Подход YaRN «NTK-by-parts» сохраняет высокочастотные (локальные) измерения при интерполяции низкочастотных (дальних) измерений, чтобы избежать повреждения локальных деталей.
В чем ключевое преимущество YaRN в эффективности по сравнению с обучением модели с длинным контекстом с нуля?
YaRN может расширять контекст, используя примерно 0,1% исходных данных обучения и небольшое количество шагов тонкой настройки, что намного дешевле, чем переобучение.
Какие дополнительные настройки, помимо изменения масштаба частот, применяет YaRN для поддержания стабильности внимания на больших расстояниях?
YaRN изменяет температуру внимания, чтобы компенсировать сдвиг энтропии/логита, который возникает, когда последовательности становятся намного длиннее.
Какая проблема возникает, если вы передаете последовательности модели RoPE намного дольше, чем она была обучена, без какого-либо масштабирования?
RoPE плохо обобщает невидимые длинные позиции, поэтому качество ухудшается, если частоты не будут изменены.