РУКОВОДСТВО ПО ЯЗЫКУ ИИ

Смещение позиции ALiBi

ALiBi (Внимание с линейными смещениями) — это умный способ дать преобразователям ощущение порядка слов без традиционных вложений позиций.

2 минуты чтенияПоследнее обновление

Обзор

It lets a model trained on short text handle much longer inputs at inference time.

Глубокое погружение

Трансформаторы не имеют встроенного понятия порядка слов, поэтому им нужен способ кодирования позиции. Классический подход добавляет позиционные вложения к векторам токенов. ALiBi, представленный Прессом, Смитом и Льюисом в 2021 году, полностью их исключает. Вместо этого он напрямую подталкивает оценку внимания: когда токен запроса смотрит на ключевой токен, ALiBi вычитает штраф, пропорциональный расстоянию между ними. Токены, находящиеся далеко друг от друга, получают больший штраф, поэтому модель, естественно, предпочитает ближайший контекст. Каждая голова внимания имеет свой собственный фиксированный штрафной наклон, поэтому некоторые головы смотрят локально, а другие видят дальше. Поскольку смещение является всего лишь функцией расстояния, ALiBi изящно экстраполирует на последовательности, гораздо более длинные, чем те, которые наблюдались при обучении.

Техническая информация

Для запроса в позиции i и ключа в позиции j ALiBi добавляет m * (j - i) к исходному показателю внимания перед softmax, где m — константа, специфичная для головы (наклоны образуют геометрическую последовательность, например 1/2, 1/4, 1/8). Поскольку j меньше или равен i в причинном внимании, этот термин равен нулю или отрицателен, что наказывает удаленные токены. Никаких изученных параметров и внедрений не добавляется, поэтому единственными накладными расходами являются предварительно вычисленная матрица смещения.

Стратегическое воздействие

Скорость и масштаб

Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.

Доступ и охват

Это расширяет доступ к различным языкам и стилям общения.

Более четкие решения

Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.

Будущее предвзятости позиции ALiBi

ALiBi доказала, что относительные смещения, основанные на расстоянии, превосходят встраивания абсолютных позиций для обобщения длины, и эта идея теперь пронизывает современный дизайн с длинным контекстом. В некоторых последних моделях вместо этого используется вращающееся встраивание (RoPE), но ALiBi остается популярным там, где важна экстремальная экстраполяция, и использовался в таких моделях, как BLOOM и MPT. Ожидайте продолжения гибридных экспериментов, сочетающих смещения по расстоянию с масштабированием RoPE, поскольку лаборатории расширяют контекстные окна до миллионов токенов без переобучения с нуля.

Реальная реализация

Обучение чат-бота на примерах с 1024 токенами, но развертывание его на документах с 4096 токенами без переобучения, полагаясь на экстраполяцию ALiBi.

Многоязычная модель BLOOM 176B, в которой для обработки позиций используется ALiBi.

Модели MPT MosaicML, которые использовали ALiBi для эффективного объявления неограниченной длины контекста при выводе.

Обобщение длинных юридических контрактов, которые превышают первоначальную продолжительность обучения модели, где предвзятость ближайшего контекста обеспечивает когерентность внимания.

Риски и ограничения

Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.

Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.

Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.

Дорожная карта реализации

1

Перед развертыванием определите выходной формат, тон и стандарты качества.

2

Наземные ответы с помощью надежных источников, когда точность имеет значение.

3

Обеспечьте контрольную точку человеческого контроля для получения важных результатов.

4

Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ALiBi Position Bias quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Интерполяция позиции для расширения контекста

Часто задаваемые вопросы

What is ALiBi Position Bias?

ALiBi (Внимание с линейными смещениями) — это умный способ дать преобразователям ощущение порядка слов без традиционных вложений позиций. Это позволяет модели, обученной на коротком тексте, обрабатывать гораздо более длинные входные данные во время вывода.

Что означает АЛиБи?

ALiBi — сокращение от «Внимание с линейными смещениями», названное в честь линейного штрафа, который оно добавляет к показателям внимания.

Как ALiBi наказывает удаленные токены?

ALiBi вычитает значение, пропорциональное расстоянию ключа запроса, из оценки внимания, поэтому более дальние токены получают меньший вес.

Каково самое знаменитое практическое преимущество ALiBi?

Поскольку смещение зависит только от расстояния, модели, обученные на коротких последовательностях, могут обрабатывать гораздо более длинные последовательности во время вывода.

Чем отличается линейное смещение внимания?

ALiBi назначает каждой головке отдельный фиксированный наклон (например, 1/2, 1/4, 1/8), поэтому разные головки присутствуют на разных диапазонах.

Сколько изученных параметров добавляет ALiBi по сравнению с традиционными позиционными вложениями?

ALiBi не вводит новых изученных параметров; наклоны на голову являются заранее заданными константами.