Мова AI GUIDE

Зміщення позиції ALiBi

ALiBi (Attention with Linear Biases) — це розумний спосіб надати трансформаторам відчуття порядку слів без традиційного вбудовування позицій.

2 хвилини читанняОстаннє оновлення

Огляд

Це дозволяє моделі, навченій короткому тексту, обробляти значно довші вхідні дані під час виведення.

Глибоке занурення

Трансформери не мають вбудованого поняття порядку слів, тому їм потрібен спосіб кодування позиції. Класичний підхід додає позиційні вбудовування до векторів токенів. ALiBi, представлений Press, Smith і Lewis у 2021 році, повністю їх викидає. Натомість він напряму підштовхує показники уваги: ​​коли маркер запиту дивиться на ключовий маркер, ALiBi віднімає штраф, пропорційний відстані між ними. Токени, які знаходяться далеко один від одного, отримують більший штраф, тому модель природно віддає перевагу контексту поблизу. Кожна голова уваги отримує власний фіксований нахил штрафу, тому деякі голови дивляться локально, а інші бачать далі. Оскільки зміщення є лише функцією відстані, ALiBi витончено екстраполює послідовності, набагато довші, ніж ті, що спостерігаються під час навчання.

Технічне розуміння

Для запиту в позиції i та ключа в позиції j ALiBi додає m * (j - i) до необробленої оцінки уваги перед softmax, де m є константою, що залежить від голови (нахили утворюють геометричну послідовність, наприклад 1/2, 1/4, 1/8). Оскільки j менше або дорівнює i в каузальній увазі, цей термін дорівнює нулю або від’ємний, штрафуючи віддалені токени. Жодних вивчених параметрів і вбудовувань не додається, тому єдині додаткові витрати — це попередньо обчислена матриця зміщення.

Стратегічний вплив

Швидкість і масштаб

Мовні робочі процеси можуть рухатися швидше без шкоди для узгодженості.

Доступ і охоплення

Це розширює доступ до різних мов і стилів спілкування.

Чіткіші рішення

Команди можуть витрачати більше часу на оцінювання, поки автоматизація справляється з повторенням.

Майбутнє зміщення позиції ALiBi

ALiBi довів, що відносні зміщення, засновані на відстані, перемагають вбудовані абсолютні позиції для узагальнення довжини, і ця ідея тепер пронизує сучасний дизайн довгоконтексту. У деяких останніх моделях натомість віддають перевагу поворотним вбудованим системам (RoPE), але ALiBi залишається популярним там, де має значення екстремальна екстраполяція, і використовувався в таких моделях, як BLOOM і MPT. Очікуйте продовження гібридних експериментів, поєднуючи зміщення відстані з масштабуванням RoPE, оскільки лабораторії просувають контекстні вікна до мільйонів токенів без перенавчання з нуля.

Реалізація в реальному світі

Навчання чат-бота на прикладах із 1024 токенів, але його розгортання на документах із 4096 токенів без повторного навчання, покладаючись на екстраполяцію ALiBi.

Багатомовна модель BLOOM 176B, яка використовує ALiBi для обробки позицій.

MPT-моделі MosaicML, які використовували ALiBi для ефективного оголошення необмеженої довжини контексту під час висновку.

Узагальнення тривалих юридичних контрактів, які перевищують початкову тривалість навчання моделі, де упередженість найближчого контексту зберігає увагу узгодженою.

Ризики та огорожі

Галюциновані факти можуть непомітно входити у звіти, допоміжні потоки або результати досліджень.

Делікатність підказок може створити суперечливі результати для подібних запитів.

Конфіденційні текстові дані можуть бути розкриті, якщо контроль доступу слабкий.

Дорожня карта впровадження

1

Визначте вихідний формат, тон і стандарти якості перед розгортанням.

2

Якщо точність має значення, зв’яжіться з надійними джерелами.

3

Тримайте контрольну точку перевірки людьми для отримання високих ставок.

4

Відстежуйте моделі збоїв і регулярно перенавчайте підказки або робочі процеси.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ALiBi Position Bias quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Інтерполяція позиції для розширення контексту

Часті запитання

Що таке упередження позиції ALiBi?

ALiBi (Attention with Linear Biases) — це розумний спосіб надати трансформаторам відчуття порядку слів без традиційного вбудовування позицій. Це дозволяє моделі, навченій короткому тексту, обробляти набагато довші вхідні дані під час висновку.

Що означає ALiBi?

ALiBi є скороченням від Attention with Linear Biases, названого на честь лінійного штрафу, який він додає до показників уваги.

Як ALiBi штрафує віддалені токени?

ALiBi віднімає від показника уваги значення, пропорційне відстані запиту до ключа, тому дальніші маркери отримують меншу вагу.

Яка найвідоміша практична перевага ALiBi?

Оскільки зміщення залежить лише від відстані, моделі, навчені на коротких послідовностях, можуть працювати з набагато довшими під час висновку.

Чим відрізняється лінійне зміщення між головами уваги?

ALiBi призначає кожній голові окремий, фіксований нахил (наприклад, 1/2, 1/4, 1/8), тому різні голови відвідують різні діапазони.

Порівняно з традиційним позиційним вбудовуванням, ALiBi додає скільки вивчених параметрів?

ALiBi не вводить нових вивчених параметрів; нахили на душу населення є заздалегідь визначеними константами.