РУКОВОДСТВО ПО ЯЗЫКУ ИИ

Вложения вращательного положения

Встраивание ротационных позиций (RoPE) кодирует расположение каждого токена в последовательности путем поворота его векторов запроса и ключей на угол, пропорциональный положению.

2 минуты чтенияПоследнее обновление

Обзор

This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.

Глубокое погружение

Трансформаторы не имеют встроенного чувства порядка, поэтому им необходимо каким-то образом добавлять информацию о положении. Ранние модели добавляли к входным данным фиксированные синусоидальные векторы или встраивания изученных позиций. RoPE, предложенный Су и его коллегами в 2021 году, использует другой подход: вместо добавления вектора позиции он поворачивает пары измерений в запросе и ключевых векторах на угол, который растет вместе с положением токена. Когда модель вычисляет скалярное произведение между запросом в позиции m и ключом в позиции n, математические вычисления работают так, что результат зависит только от их относительного расстояния m минус n. Это дает подлинное осознание относительного положения, хорошо работает с эффективными ядрами внимания и плавно ослабляет внимание с расстоянием. RoPE сейчас используется в Llama, Mistral, Qwen и большинстве современных открытых моделей.

Техническая информация

RoPE обрабатывает встраиваемые измерения парами и применяет двумерное вращение к каждой паре, при этом разные пары вращаются с разной частотой, подобно тому, как стрелки многих часов тикают с разной скоростью. Поскольку вращение на позицию m и последующее скалярное произведение с чем-то, повернутым на позицию n, оставляет только разницу углов, оценки внимания становятся функциями относительного положения. Высокочастотные пары улавливают прекрасный локальный порядок; низкочастотные пары захватывают дальнее положение. Важно отметить, что он изменяет запросы и ключи, а не значения.

Стратегическое воздействие

Скорость и масштаб

Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.

Доступ и охват

Это расширяет доступ к различным языкам и стилям общения.

Более четкие решения

Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.

Будущее вложений вращающихся позиций

Большая часть недавних работ сосредоточена на расширении RoPE до контекстов, гораздо более длительных, чем было обучено модель. Такие методы, как интерполяция положения, масштабирование с учетом NTK и YaRN, регулируют частоты вращения, чтобы модель, обученная, скажем, на токенах 4K, могла обрабатывать 32K или более с небольшой точной настройкой. Ожидается, что RoPE останется доминирующей позиционной схемой с постоянными улучшениями ее базовой частоты и масштабированием для контекстов с миллионами токенов, а также с постоянным изучением того, как она взаимодействует с поведением внимания.

Реальная реализация

Предоставление моделям Llama, Mistral и Qwen чувства порядка токенов без отдельных вложений позиций.

Расширение полезного контекста модели с нескольких тысяч до десятков тысяч токенов с помощью интерполяции или YaRN.

Помогает моделям кода отслеживать относительные расстояния между скобками, функциями и ссылками в длинных файлах.

Поддержка ответов на длинные вопросы, когда имеет значение относительное положение между вопросом и доказательствами.

Риски и ограничения

Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.

Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.

Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.

Дорожная карта реализации

1

Перед развертыванием определите выходной формат, тон и стандарты качества.

2

Наземные ответы с помощью надежных источников, когда точность имеет значение.

3

Обеспечьте контрольную точку человеческого контроля для получения важных результатов.

4

Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rotary Position Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Смещение позиции ALiBi

Часто задаваемые вопросы

What is Rotary Position Embeddings?

Встраивание ротационных позиций (RoPE) кодирует расположение каждого токена в последовательности путем поворота его векторов запроса и ключей на угол, пропорциональный положению. Этот элегантный трюк позволяет трансформерам понимать относительные расстояния и изящно расширять их на более длинные контексты.

Как RoPE вводит информацию о положении в трансформатор?

RoPE поворачивает векторы запроса и ключа на угол, пропорциональный положению, вместо добавления отдельного вектора положения.

Какие части вычисления внимания модифицирует RoPE?

RoPE применяет ротацию к векторам запроса и ключей, оставляя векторы значений нетронутыми.

Почему в RoPE разные пары измерений вращаются с разной частотой?

Подобно тому, как стрелки часов тикают с разной скоростью, различные частоты позволяют одним парам кодировать ближний порядок, а другим — дальнее положение.

Какова цель таких методов, как интерполяция положения, масштабирование с учетом NTK и YaRN?

Эти методы изменяют масштаб частоты вращения RoPE, поэтому модель может обрабатывать гораздо более длинные контексты, чем ее исходная длина обучения.