Jazyk AI GUIDE

Posuvné okno Pozor

Pozornost posuvného okna omezuje každý token tak, aby se věnoval pouze sousedství s pevnou velikostí blízkých tokenů namísto celé sekvence.

2 minuty čteníNaposledy aktualizováno

Přehled

To snižuje kvadratické náklady standardní pozornosti na lineární úroveň, což činí dlouhokontextové modely mnohem levnějšími na provoz.

Hluboký ponor

Standardní sebepozorování porovnává každý token s každým dalším tokenem, takže sekvence délky N vyžaduje srovnání zhruba N-kvadrát. Pozornost posuvného okna to řeší tím, že každému tokenu přidělí okno velikosti W (řekněme 4 096 tokenů) a věnuje se pouze sousedům uvnitř tohoto okna. Náklady rostou jako N krát W namísto N-squared. Rozhodující je, že vrstvení mnoha okenních vrstev rozšiřuje efektivní receptivní pole: po L vrstvách se informace mohou šířit přes zhruba L krát W tokenů, jako rostoucí receptivní pole CNN. Mistral 7B to zpopularizoval s oknem 4 096 tokenů ve 32 vrstvách, čímž dosáhl teoretického rozpětí 131 000 tokenů. Modely často kombinují vrstvy s okny s občasnými vrstvami s plnou pozorností, aby se zachovaly odkazy na dlouhé vzdálenosti.

Technický přehled

V masce pozornosti může dotaz na pozici i vidět pouze klíče z pozic i mínus W plus 1 až i (kauzální případ). Tato řídká maska ​​znamená, že mezipaměť KV potřebuje pouze posledních W tokenů na vrstvu, což snižuje paměť během generování. Protože se okno s každým novým tokenem posouvá, přirozeně se spáruje s mezipamětí, která přepisuje nejstarší položky, místo aby věčně rostla.

Strategický dopad

Rychlost a měřítko

Jazykové pracovní postupy se mohou pohybovat rychleji, aniž by byla obětována konzistentnost.

Přístup a dosah

Rozšiřuje přístup napříč jazyky a komunikačními styly.

Jasnější rozhodnutí

Týmy mohou strávit více času úsudkem, zatímco automatizace zvládne opakování.

Budoucnost posuvných oken Pozornost

Hybridní návrhy nyní prokládají několik globálních vrstev nebo vrstev s plnou pozorností mezi mnoha vrstvami posuvných oken, čímž vyvažují efektivitu se skutečným uvažováním na dlouhé vzdálenosti. Gemma 2 a další střídají lokální a globální bloky. Očekávejte, že pozornost okna se zkombinuje s modely stavového prostoru, propady pozornosti a kompresí mezipaměti KV, takže hraniční modely zvládnou kontexty milionů tokenů bez ztráty paměti. Stává se spíše výchozím stavebním kamenem než exotickou optimalizací.

Real-World Implementace

Mistral 7B používá 4 096-tokenové posuvné okno ve svých vrstvách, aby levně zpracovávalo dlouhé výzvy na spotřebitelských GPU.

Longformer aplikuje pozornost v okně plus několik globálních tokenů pro klasifikaci a shrnutí vícestránkových dokumentů.

Gemma 2 střídá vrstvy lokálního posuvného okna s vrstvami globální pozornosti, aby vyvážila rychlost a vyvolání na velké vzdálenosti.

Rolling-buffer KV mezipaměti v chatových asistentech uchovávají pouze nejnovější okno tokenů, což omezuje paměť během dlouhých konverzací.

Rizika a zábradlí

Halucinovaná fakta mohou tiše vstupovat do zpráv, podpůrných toků nebo výstupů výzkumu.

Citlivost na výzvy může způsobit nekonzistentní výsledky napříč podobnými požadavky.

Citlivá textová data mohou být vystavena, pokud je řízení přístupu slabé.

Plán implementace

1

Před zavedením definujte výstupní formát, tón a standardy kvality.

2

Pozemní reakce s důvěryhodnými zdroji, kdykoli záleží na přesnosti.

3

Udržujte kontrolní bod lidské kontroly pro vysoce důležité výstupy.

4

Sledujte vzorce selhání a pravidelně opakujte výzvy nebo pracovní postupy.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sliding Window Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Pozornost na seskupené dotazy

Často kladené otázky

Co je to Attention s posuvným oknem?

Pozornost posuvného okna omezuje každý token tak, aby se věnoval pouze sousedství s pevnou velikostí blízkých tokenů namísto celé sekvence. To snižuje kvadratické náklady na standardní pozornost na lineární, takže provoz modelů s dlouhým kontextem je mnohem levnější.

Jaká je hlavní výpočetní výhoda pozornosti posuvného okna oproti standardní vlastní pozornosti?

Omezením každého tokenu na pevné okno W sousedů rostou náklady jako N krát W (lineární v N) spíše než jako N-kvadrát.

Jak může v designu Mistral 7B informace stále cestovat daleko za jediné okno se 4 096 tokeny?

Stejně jako CNN posouvá každá vrstva informace o jedno okno dále, takže L vrstvy poskytují efektivní rozsah zhruba L krát W tokenů.

Proč pozornost posuvného okna snižuje paměť během generování textu?

Vzhledem k tomu, že token se stará pouze o své poslední okno, mohou být starší položky klíč/hodnota zahozeny, často prostřednictvím mezipaměti.

Jakou volbu designu používají modely jako Gemma 2 spolu s posuvnými okny, aby uvažovaly na dlouhé vzdálenosti?

Míchání příležitostných globálních vrstev/vrstvy s plnou pozorností mezi lokálními zachovává skutečná spojení na dlouhé vzdálenosti, která čisté vytváření oken oslabuje.

Pro kauzální posuvné okno o velikosti W, které klávesy lze dotazovat na pozici, které se mám věnovat?

V kauzálním případě dotaz vidí sebe a tokeny W mínus 1 bezprostředně před ním, nikdy budoucí tokeny.