Език AI РЪКОВОДСТВО

Модели на оскъдно внимание

Оскъдното внимание прави Transformers по-евтини, като позволява на всеки токен да се грижи само за внимателно избрана подгрупа от други токени, а не за всички тях.

2 min readПоследна актуализация

Преглед

This trades a little global reach for big savings in memory and compute on long sequences.

Дълбоко гмуркане

Пълното самовнимание сравнява всеки токен с всеки друг токен, така че цената расте с квадрата на дължината на последователността, което става болезнено за дълги документи. Оскъдното внимание заменя плътния модел със структуриран. Общите дизайни включват (локално) внимание с плъзгащ се прозорец, където всеки жетон вижда само близки съседи; набраздени или разширени шарки, които прескачат напред, за да достигнат евтино до далечен контекст; и глобални токени, няколко специални позиции, които се грижат за всичко и за което всичко се грижи, действайки като информационни центрове. Модели като Longformer, BigBird и Sparse Transformer ги комбинират, така че общият брой на връзките расте приблизително линейно вместо квадратично, което позволява контексти от хиляди до десетки хиляди токени.

Техническа информация

Вместо пълна N-по-N матрица на вниманието, разреденото внимание изчислява само избрани записи, често обединение на локален прозорец и няколко глобални реда и колони. BigBird прочуто доказа, че комбинирането на случайни, прозоречни и глобални връзки запазва теоретичната изразителност на пълното внимание, като същевременно намалява сложността от O(N на квадрат) към O(N). Ефективните ядра пропускат изцяло маскираните записи, вместо да ги изчислят и след това да ги нулират.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на моделите на оскъдно внимание

Разреденото внимание остава централно за моделирането на дълъг контекст, все повече съчетано с оптимизирани ядра като FlashAttention и с научена или динамична разреденост, която избира кои токени да се обърне на вход. Тъй като контекстните прозорци се простират към милиони токени, хибридните стекове смесват редки, плътни и слоеве на пространството на състоянието. Очаквайте хардуерно оскъдни ядра и внимание, базирано на маршрутизиране, за да продължите да намалявате разходите за четене на много дълги входове.

Внедряване в реалния свят

Longformer обработва цели научни статии или правни документи с едно преминаване, използвайки плъзгащ се прозорец плюс глобално внимание

BigBird обработва дълъг документ с отговори на въпроси и геномни последователности с внимание с линейно мащабиране

Обобщаване на текст с дължина на книга, където пълното внимание би изчерпало паметта на GPU

Системи за извличане и чат с дълъг контекст, които използват глобални хъб токени за маршрутизиране на ключова информация през хиляди токени

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sparse Attention Patterns quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Block-Sparse и Native Sparse внимание

Frequently asked questions

What is Sparse Attention Patterns?

Оскъдното внимание прави Transformers по-евтини, като позволява на всеки токен да се грижи само за внимателно избрана подгрупа от други токени, а не за всички тях. Това разменя малък глобален обхват за големи спестявания на памет и изчисления на дълги поредици.

Защо пълното самовнимание е скъпо при дълги поредици?

Пълното внимание сравнява всеки токен с всеки друг токен, като дава O(N на квадрат) цена във времето и паметта.

Какво е (локално) внимание с плъзгащ се прозорец?

Местното внимание ограничава изгледа на всеки токен до фиксиран прозорец от околните токени, което драстично намалява разходите.

Каква е целта на „глобалните токени“ при оскъдно внимание?

Няколко глобални жетона се свързват с всички позиции, позволявайки на информацията да тече през цялата последователност евтино.

Кой модел доказа, че комбинирането на случайно, прозорец и глобално внимание запазва пълната изразителност на вниманието?

BigBird показа, че неговият разреден модел е универсален апроксиматор на последователни функции, като същевременно мащабира грубо линейно.

Приблизително как се мащабира броят на връзките в добре проектираното рядко внимание?

Чрез ограничаване на връзките до локални прозорци плюс няколко глобални връзки, общите връзки нарастват линейно.