Техническо РЪКОВОДСТВО

Линейно внимание и ядра на изпълнителя

Линейното внимание заменя квадратичното меко максимално внимание в Transformers с математически трик, който се мащабира линейно с дължината на последователността.

2 min readПоследна актуализация

Преглед

Performer is a landmark method that approximates softmax using random feature kernels, making very long sequences computationally affordable.

Дълбоко гмуркане

Стандартното внимание на трансформатора изчислява резултат между всяка двойка токени, като струва време и памет, които растат с квадрата на дължината на последователността (O(n^2)). Линейното внимание пренаписва изчислението, така че цената нараства само линейно (O(n)). Ключовата идея: softmax вниманието е softmax(QK^T)V, но ако замените softmax с карта на характеристиките на ядрото phi, получавате phi(Q)(phi(K)^T V). Тъй като умножението на матрицата е асоциативно, вие първо изчислявате phi(K)^T V (малка матрица d-by-d), като изцяло избягвате гигантската матрица с резултати n-by-n. Изпълнител, от Google през 2020 г., прави това вярно приближение на истинския softmax, използвайки FAVOR+ (Fast Attention Via positive Orthogonal Random features), изготвяйки произволни проекции, които поддържат оценките на ядрото безпристрастни и стабилни.

Техническа информация

Performer's FAVOR+ приближава softmax ядрото exp(q.k), използвайки положителни произволни характеристики: картографира заявки и ключове чрез произволни гаусови проекции, обвити в експоненциал, гарантирайки неотрицателни тегла на вниманието и избягвайки числените нестабилности на по-ранните оценители. Използването на ортогонални произволни характеристики намалява дисперсията. Най-важното е, че матрицата на вниманието n-по-n никога не се материализира, така че паметта пада от квадратична на линейна, позволявайки последователности от десетки хиляди токени.

Стратегическо въздействие

Cost and budget

Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.

Clearer decisions

Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.

Quality control

По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.

Бъдещето на линейното внимание и ядрата на изпълнителите

Чистото линейно внимание често изостава от softmax по отношение на качеството, така че полето се сближава с хибриди: модели на пространството на състоянието (Mamba), затворено линейно внимание и архитектури, които смесват няколко слоя с пълно внимание с много линейни. Тъй като контекстните прозорци се насочват към милиони токени, линейните и подквадратичните механизми стават все по-привлекателни по отношение на разходите, а линейното внимание в повтарящ се стил се преразглежда за ефективни изводи за поточно предаване и модели на устройството.

Внедряване в реалния свят

Обработката на дълги геномни или протеинови последователности, където пълното квадратично внимание би изтощило GPU паметта

Обобщаване на ниво документ върху много дълги отчети без разделяне, използвайки гръбнак в стил Performer

Ефективно дългоформатно аудио или моделиране на времеви серии, където последователностите обхващат десетки хиляди стъпки

Намаляване на разходите за изводи в модели на чат с дълъг контекст чрез замяна на някои слоеве softmax с варианти на линейно внимание

Рискове и предпазни огради

Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.

Разходите за инфраструктура и поддръжка често се подценяват.

Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.

Пътна карта за изпълнение

1

Определете целите за латентност, качество и разходи преди внедряването.

2

Бенчмарк при реалистични условия на натоварване и данни.

3

Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.

4

Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Linear Attention and Performer Kernels quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

RWKV Линейно внимание

Frequently asked questions

What is Linear Attention and Performer Kernels?

Линейното внимание заменя квадратичното меко максимално внимание в Transformers с математически трик, който се мащабира линейно с дължината на последователността. Performer е забележителен метод, който приближава softmax с помощта на произволни функционални ядра, което прави много дълги последователности изчислително достъпни.

Защо стандартното softmax внимание се мащабира лошо с дължината на последователността?

Softmax внимание сравнява всяка двойка жетони, създавайки n-по-n матрица с резултати, така че цената нараства като O(n^2).

Кое математическо свойство позволява на линейното внимание да избегне матрицата n-по-n?

Тъй като умножението на матрицата е асоциативно, можете първо да изчислите phi(K)^T V, малка матрица d-by-d, вместо phi(Q)phi(K)^T.

Какво приблизително представлява механизмът FAVOR+ на Performer?

FAVOR+ използва положителни ортогонални произволни характеристики, за да апроксимира експоненциалното мекомаксимално ядро, без да формира пълната матрица на вниманието.

Защо Performer използва положителни произволни характеристики, а не по-ранните тригонометрични?

Положителните характеристики поддържат оценките на ядрото неотрицателни, избягвайки нестабилността и отрицателните стойности, които измъчваха по-ранните карти на функциите sin/cos.

Каква е приблизителната сложност на линейното внимание в стила на изпълнител в дължина на последователност n?

Чрез пренареждане на изчислението и никога не изграждане на матрицата n-по-n, разходите се мащабират линейно с дължината на последователността.