Език AI РЪКОВОДСТВО

Плъзгащ се прозорец Внимание

Вниманието на плъзгащия се прозорец ограничава всеки токен да присъства само на съседство с фиксиран размер от близки токени, вместо на цялата последователност.

2 min readПоследна актуализация

Преглед

This cuts the quadratic cost of standard attention down to linear, making long-context models far cheaper to run.

Дълбоко гмуркане

Стандартното самовнимание сравнява всеки токен с всеки друг токен, така че последователност с дължина N изисква грубо сравнения на N-квадрат. Плъзгащото внимание на прозореца коригира това, като дава на всеки токен прозорец с размер W (да речем 4096 токена) и обръща внимание само на съседите вътре в този прозорец. Разходите нарастват като N пъти W вместо N-квадрат. Най-важното е, че подреждането на много прозоречни слоеве разширява ефективното възприемчиво поле: след L слоя информацията може да се разпространява през приблизително L пъти W токени, като нарастващото възприемчиво поле на CNN. Mistral 7B популяризира това с прозорец от 4096 токена в 32 слоя, достигайки теоретичен обхват от 131K токена. Моделите често смесват прозоречни слоеве със случайни слоеве с пълно внимание, за да запазят връзките на дълги разстояния.

Техническа информация

В маската за внимание на заявка на позиция i е разрешено само да вижда ключове от позиции i минус W плюс 1 до i (причинно-следствен случай). Тази рядка маска означава, че KV кешът се нуждае само от последните W токени на слой, намалявайки паметта по време на генерирането. Тъй като прозорецът се измества с всеки нов токен, той се сдвоява естествено с подвижния буферен кеш, който презаписва най-старите записи, вместо да расте завинаги.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на вниманието на плъзгащия се прозорец

Хибридните дизайни сега преплитат няколко глобални слоя или слоя с пълно внимание между много слоеве с плъзгащи се прозорци, балансирайки ефективността с истинското дългосрочно разсъждение. Gemma 2 и други редуват локални и глобални блокове. Очаквайте вниманието на прозореца да се комбинира с модели на пространството на състоянието, поглъщане на внимание и компресиране на KV-кеша, така че граничните модели да обработват контексти с милиони токени без ненужна памет. Той се превръща в градивен елемент по подразбиране, а не в екзотична оптимизация.

Внедряване в реалния свят

Mistral 7B използва плъзгащ се прозорец с 4096 жетона през своите слоеве, за да обработва евтино дълги подкани на потребителски GPU.

Longformer прилага прозоречно внимание плюс няколко глобални токена за класифициране и обобщаване на многостранични документи.

Gemma 2 редува локални слоеве с плъзгащи се прозорци със слоеве за глобално внимание, за да балансира скоростта и извикването на дълги разстояния.

KV кешовете с подвижни буфери в асистентите за чат съхраняват само най-скорошния прозорец от токени, ограничавайки паметта по време на дълги разговори.

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sliding Window Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Групирана заявка внимание

Frequently asked questions

What is Sliding Window Attention?

Вниманието на плъзгащия се прозорец ограничава всеки токен да присъства само на съседство с фиксиран размер от близки токени, вместо на цялата последователност. Това намалява квадратичната цена на стандартното внимание до линейна, което прави моделите с дълъг контекст много по-евтини за изпълнение.

Каква е основната изчислителна полза от вниманието на плъзгащия се прозорец пред стандартното самовнимание?

Чрез ограничаване на всеки токен до фиксиран прозорец от W съседи, цената нараства като N пъти W (линейно в N), а не като N-квадрат.

В дизайна на Mistral 7B, как може информацията да пътува далеч отвъд един прозорец от 4096 токена?

Подобно на CNN, всеки слой избутва информация един прозорец напред, така че L слоя дават ефективен обхват от приблизително L пъти W токени.

Защо вниманието на плъзгащия се прозорец намалява паметта по време на генериране на текст?

Тъй като токенът обръща внимание само на последния си прозорец, по-старите записи на ключ/стойност могат да бъдат отхвърлени, често чрез подвижен буферен кеш.

Какъв избор на дизайн използват модели като Gemma 2 заедно с плъзгащи се прозорци, за да поддържат разсъжденията на далечни разстояния?

Смесването от време на време на глобални/пълно внимание слоеве между локални запазва истинските връзки на дълги разстояния, които чистият прозорец отслабва.

За причинно-следствен плъзгащ се прозорец с размер W, на кои клавиши може да се обърне заявка в позиция I?

В причинно-следствения случай заявката вижда себе си и токените W минус 1 непосредствено преди него, никога бъдещи токени.