Ritka figyelemminta
A ritka figyelem olcsóbbá teszi a Transformers-t, mivel az egyes tokenek csak a többi tokenek egy gondosan kiválasztott részhalmazát kezelik, nem pedig az összeset.
Áttekintés
This trades a little global reach for big savings in memory and compute on long sequences.
Mély merülés
A teljes önfigyelem minden tokent minden más tokenhez hasonlít, így a költség a sorozat hosszának négyzetével nő, ami fájdalmassá válik a hosszú dokumentumok esetében. A gyér figyelem a sűrű mintát strukturáltra cseréli. A gyakori tervek közé tartozik a csúszóablak (helyi) figyelem, ahol minden token csak a közeli szomszédokat látja; lépcsőzetes vagy tágított minták, amelyek előrelépnek, hogy olcsón elérjék a távoli kontextust; és globális tokenek, néhány speciális pozíció, amelyek mindenre kiterjednek, és amelyekre minden gondoskodik, információs központként működve. Az olyan modellek, mint a Longformer, a BigBird és a Sparse Transformer kombinálják ezeket, így a kapcsolatok teljes száma nagyjából lineárisan növekszik a négyzetes helyett, lehetővé téve a több ezer-tízezer tokenek kontextusát.
Technikai betekintés
A teljes N-szeres figyelemmátrix helyett a ritka figyelem csak a kiválasztott bejegyzéseket számítja ki, gyakran egy helyi ablak és néhány globális sor és oszlop egyesítését. A BigBird híresen bebizonyította, hogy a véletlenszerű, ablakos és globális kapcsolatok kombinálása megőrzi a teljes figyelem elméleti kifejezőképességét, miközben csökkenti a komplexitást O(N négyzet) O(N) felé. A hatékony kernelek teljesen kihagyják a maszkolt bejegyzéseket, nem pedig kiszámítják, majd nullázzák azokat.
Stratégiai hatás
Sebesség és méretarány
A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.
Hozzáférés és elérés
Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.
Tisztább döntések
A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.
A ritka figyelemmintázatok jövője
A ritka figyelem továbbra is központi szerepet játszik a hosszú kontextusú modellezésben, egyre inkább párosul az olyan optimalizált kernelekkel, mint a FlashAttention, valamint a tanult vagy dinamikus ritkasággal, amely bemenetenként kiválasztja, hogy mely tokeneket kell figyelembe venni. Ahogy a kontextusablak több millió tokenek felé nyúlik, a hibrid veremek ritka, sűrű és állapottér rétegeket kevernek. A hardvertudatos ritka kernelekre és az útválasztáson alapuló figyelemre kell számítani, hogy folyamatosan csökkenjenek a nagyon hosszú bemenetek olvasásának költségei.
Valós megvalósítás
A Longformer teljes tudományos dolgozatokat vagy jogi dokumentumokat dolgoz fel egy menetben, csúszóablak és globális figyelem segítségével
A BigBird hosszú dokumentum-kérdések megválaszolása és genomikai szekvenciák kezelése lineáris skálázással
Könyvnyi szöveg összegzése, ahol a teljes figyelem kimerítené a GPU memóriáját
Visszakereső és hosszú kontextusú csevegőrendszerek, amelyek globális hub tokeneket használnak a kulcsfontosságú információk több ezer tokenek között történő irányítására
Kockázatok és védőkorlátok
A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.
Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.
Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.
Végrehajtási ütemterv
A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.
Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.
Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.
Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Sparse Attention Patterns quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Block-Sparse és Native Sparse Attention
Gyakran ismételt kérdések
What is Sparse Attention Patterns?
A ritka figyelem olcsóbbá teszi a Transformers-t, mivel az egyes tokenek csak a többi tokenek egy gondosan kiválasztott részhalmazát kezelik, nem pedig az összeset. Ezzel egy kis globális hozzáférést nagy memória-megtakarításra és hosszú sorozatokon való számításra vált.
Miért drága a teljes önfigyelés a hosszú sorozatoknál?
A teljes figyelem minden tokent összehasonlít minden más tokennel, így O(N négyzet) költséget ad az idő és a memória tekintetében.
Mi az a tolóablakos (helyi) figyelem?
A helyi figyelem az egyes tokenek nézetét a környező tokenek rögzített ablakára korlátozza, ami jelentősen csökkenti a költségeket.
Mi a célja a „globális tokenek” gyér figyelemben?
Néhány globális token csatlakozik az összes pozícióhoz, lehetővé téve az információ olcsó áramlását a teljes sorozatban.
Melyik modell bizonyította, hogy a véletlenszerű, az ablakos és a globális figyelem kombinálása megőrzi a teljes figyelem kifejezőkészségét?
A BigBird megmutatta, hogy ritka mintája a szekvenciafüggvények univerzális közelítője, miközben nagyjából lineárisan skáláz.
Körülbelül hogyan skálázódik a kapcsolatok száma a jól megtervezett ritka figyelemben?
A kapcsolatoknak a helyi ablakokra való korlátozásával és néhány globális hivatkozással az összes kapcsolat körülbelül lineárisan nő.