Nyelvi AI ÚTMUTATÓ

Tolóablak Figyelem

A csúszóablakra való figyelem korlátozza az egyes tokeneket, hogy a teljes sorozat helyett csak a közeli tokenek rögzített méretű szomszédságára figyeljenek.

2 perc olvasásUtoljára frissítve

Áttekintés

This cuts the quadratic cost of standard attention down to linear, making long-context models far cheaper to run.

Mély merülés

A szabványos önfigyelem minden tokent összehasonlít minden más tokennel, így egy N hosszúságú sorozathoz nagyjából N-négyzetes összehasonlításokra van szükség. A csúszóablak-figyelés ezt úgy javítja ki, hogy minden tokennek egy W méretű ablakot ad (mondjuk 4096 token), és csak az ablakon belüli szomszédokra figyel. A költség az N-négyzet helyett N-szeresével nő. Létfontosságú, hogy sok ablakos réteg halmozása kibővíti a hatékony befogadó mezőt: L réteg után az információ nagyjából L-szer W tokenben terjedhet, mint a CNN növekvő befogadó mezője. A Mistral 7B ezt népszerűsítette egy 4096 tokenből álló ablakkal, amely 32 rétegen keresztül terjedt el, és elérte az elméleti 131 000 token terjedelmét. A modellek gyakran keverik az ablakos rétegeket esetenként teljes figyelemfelkeltő rétegekkel, hogy megőrizzék a hosszú távú kapcsolatokat.

Technikai betekintés

A figyelemmaszkban az i pozícióban lévő lekérdezés csak az i pozícióból W plusz 1-től i-ig (ok-okozati eset) láthatja a kulcsokat. Ez a ritka maszk azt jelenti, hogy a KV gyorsítótárnak rétegenként csak az utolsó W tokenre van szüksége, ami csökkenti a memóriát a generálás során. Mivel az ablak minden új tokennel eltolódik, természetesen párosul egy gördülő puffer-gyorsítótárral, amely felülírja a legrégebbi bejegyzéseket, nem pedig örökké növekszik.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A tolóablak jövője Figyelem

A hibrid kialakítások most néhány globális vagy teljes figyelemre méltó réteget helyeznek el a sok csúszóablak-réteg között, egyensúlyba hozva a hatékonyságot a valódi hosszú távú gondolkodással. A Gemma 2 és mások helyi és globális blokkokat váltanak fel. Várható, hogy az ablakfigyelés egyesüljön az állapottér modellekkel, a figyelemnyelőkkel és a KV-gyorsítótár-tömörítéssel, így a határmodellek milliós token kontextusokat kezelnek kifutó memória nélkül. Ez inkább egy alapértelmezett építőelem, semmint egzotikus optimalizálás.

Valós megvalósítás

A Mistral 7B egy 4096 tokenből álló csúszóablakot használ a rétegeken, hogy olcsón kezelje a hosszú promptokat fogyasztói GPU-kon.

A Longformer ablakos figyelmet és néhány globális tokent alkalmaz a többoldalas dokumentumok osztályozására és összefoglalására.

A Gemma 2 felváltja a helyi csúszóablak-rétegeket a globális figyelemfelkeltő rétegekkel, hogy egyensúlyba hozza a sebességet és a hosszú távú visszahívást.

A csevegési asszisztensekben a gördülő puffer KV gyorsítótárak csak a legfrissebb tokenek ablakát tárolják, így a hosszú beszélgetések során korlátozzák a memóriát.

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sliding Window Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Csoportos lekérdezés Figyelem

Gyakran ismételt kérdések

What is Sliding Window Attention?

A csúszóablakra való figyelem korlátozza az egyes tokeneket, hogy a teljes sorozat helyett csak a közeli tokenek rögzített méretű szomszédságára figyeljenek. Ez a normál figyelem négyzetes költségét lineárisra csökkenti, így a hosszú kontextusú modellek futtatása sokkal olcsóbb.

Mi a fő számítási előnye a csúszóablak-figyelemnek a szokásos önfigyeléssel szemben?

Ha az egyes tokeneket W szomszédos fix ablakra korlátozzuk, a költség N-szer W-szor nő (lineáris N-ben), nem pedig N-négyzetben.

A Mistral 7B kialakításában hogyan juthatnak el az információk messze túl egyetlen 4096 tokenből álló ablakon?

A CNN-hez hasonlóan minden réteg egy ablakkal tovább tolja az információt, így L réteg effektív tartományt ad, nagyjából L-szer W token.

Miért csökkenti az ablakra való figyelem a memóriát a szöveggenerálás során?

Mivel egy token csak a legutóbbi ablakát veszi figyelembe, a régebbi kulcs/érték bejegyzések elvethetők, gyakran egy gördülő puffer-gyorsítótáron keresztül.

Milyen tervezési lehetőségeket alkalmaznak a Gemma 2-hez hasonló modellek a tolóablak mellett, hogy megőrizzék a hosszú távú gondolkodást?

Az alkalmankénti globális/teljes figyelmet igénylő rétegek helyi rétegek közötti keverése megőrzi a valódi távolsági kapcsolatokat, amelyeket a tiszta ablakozás gyengít.

W méretű ok-okozati csúszóablak esetén mely billentyűkre lehet lekérdezni az általam kezelt pozícióban?

Ok-okozati esetben a lekérdezés önmagát és közvetlenül előtte lévő W mínusz 1 tokeneket látja, jövőbeli tokeneket soha.