Език AI РЪКОВОДСТВО

Отклонение на позицията на ALiBi

ALiBi (Внимание с линейни отклонения) е умен начин да се даде на трансформаторите усещане за ред на думите без традиционни вграждания на позиции.

2 min readПоследна актуализация

Преглед

It lets a model trained on short text handle much longer inputs at inference time.

Дълбоко гмуркане

Transformers have no built-in notion of word order, so they need a way to encode position. The classic approach adds positional embeddings to token vectors. ALiBi, introduced by Press, Smith, and Lewis in 2021, throws those out entirely. Вместо това, той директно повишава резултатите за внимание: когато токен за заявка разглежда ключов токен, ALiBi изважда наказание, пропорционално на разстоянието между тях. Tokens that are far apart get a bigger penalty, so the model naturally prefers nearby context. Each attention head gets its own fixed penalty slope, so some heads look locally while others see farther. Because the bias is just a function of distance, ALiBi extrapolates gracefully to sequences far longer than those seen in training.

Техническа информация

За заявка в позиция i и ключ в позиция j, ALiBi добавя m * (j - i) към необработения резултат за внимание преди softmax, където m е специфична за главата константа (наклоните образуват геометрична последователност като 1/2, 1/4, 1/8). Since j is less than or equal to i in causal attention, this term is zero or negative, penalizing distant tokens. No learned parameters and no embeddings are added, so the only overhead is a precomputed bias matrix.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на отклонението на позицията на ALiBi

ALiBi доказа, че относителните отклонения, базирани на разстояние, побеждават вграждането на абсолютни позиции за обобщаване на дължината и тази идея сега прониква в съвременния дизайн с дълъг контекст. Някои скорошни модели предпочитат въртящи се вграждания (RoPE), но ALiBi остава популярен там, където екстремната екстраполация има значение и се използва в модели като BLOOM и MPT. Очаквайте продължително хибридно експериментиране, комбиниращо отклонения на разстоянието с мащабиране на RoPE, тъй като лабораториите избутват контекстни прозорци към милиони токени без преквалификация от нулата.

Внедряване в реалния свят

Обучение на чатбот на примери с 1024 токена, но внедряването му върху документи с 4096 токена без повторно обучение, разчитайки на екстраполацията на ALiBi.

Многоезичният модел BLOOM 176B, който използва ALiBi за управление на позицията.

MPT моделите на MosaicML, които използваха ALiBi за ефективно рекламиране на неограничена дължина на контекста при извод.

Обобщаване на дълги правни договори, които надхвърлят първоначалната продължителност на обучението на модела, където пристрастието към близък контекст поддържа вниманието кохерентно.

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ALiBi Position Bias quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Интерполация на позиция за разширение на контекста

Frequently asked questions

What is ALiBi Position Bias?

ALiBi (Внимание с линейни отклонения) е умен начин да се даде на трансформаторите усещане за ред на думите без традиционни вграждания на позиции. Той позволява на модел, обучен на кратък текст, да обработва много по-дълги входове по време на извод.

Какво означава ALiBi?

ALiBi е съкращение от Attention with Linear Biases, кръстено на линейното наказание, което добавя към резултатите за внимание.

Как ALiBi наказва отдалечените токени?

ALiBi изважда стойност, пропорционална на разстоянието ключ за заявка от резултата за внимание, така че по-далечните токени получават по-малко тегло.

Кое е най-известното практическо предимство на ALiBi?

Тъй като отклонението зависи само от разстоянието, моделите, обучени на кратки последователности, могат да се справят с много по-дълги по време на извод.

Какво е различното при линейното отклонение в главите на вниманието?

ALiBi присвоява на всяка глава различен, фиксиран наклон (напр. 1/2, 1/4, 1/8), така че различните глави присъстват в различни диапазони.

В сравнение с традиционните позиционни вграждания, ALiBi добавя колко научени параметри?

ALiBi не въвежда нови заучени параметри; наклоните на глава са предварително определени константи.