Nyelvi AI ÚTMUTATÓ

Több lekérdezés figyelem

A Multi-Query Attention (MQA) a transzformátor figyelem memóriakímélő csavarja, amely egyetlen kulcs- és értékkészleten osztozik az összes figyelemfejen.

2 perc olvasásUtoljára frissítve

Áttekintés

It dramatically speeds up text generation by shrinking the memory the model must shuffle around.

Mély merülés

A standard többfejes figyelem minden fejnek saját lekérdezést, kulcsot és értékprojekciót biztosít. A generálás során az összes múltbeli token kulcsát és értékét minden lépésben gyorsítótárba kell helyezni és újra kell tölteni – ez a KV gyorsítótár lesz a fő szűk keresztmetszet, mivel a memóriából való kiolvasása lassabb, mint maga a matematika. A Noam Shazeer által 2019-ben javasolt Multi-Query Attention fejenként külön lekérdezési előrejelzéseket tart, de a kulcsokat és az értékeket egyetlen megosztott fejlé teszi össze. Ez a KV-gyorsítótárat a fejek számával megegyező tényezővel csökkenti, néha 8-64-szer kisebb. Az eredmény sokkal gyorsabb autoregresszív dekódolás és kisebb memóriaterület, csak szerény minőségi csökkenés mellett. A középút, a csoportos lekérdezés figyelem egyensúlyba hozza a kompromisszumot.

Technikai betekintés

Az MQA-ban a lekérdezési súlyok továbbra is H külön lekérdezési vektort hoznak létre, de egyetlen kulcs vetület és egyetlen érték vetület van megosztva az összes fej között. Mindegyik fej saját lekérdezésével számítja ki a figyelmet, ugyanazon kulcsok és értékek alapján. Mivel a gyorsítótárazott K és V tenzorok már nem skálázódnak a fejek számával, a memória sávszélessége a dekódolás során meredeken csökken – és a sávszélesség, nem pedig a számítás, az, ami a generálás sebességét korlátozza a modern gyorsítókon.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A többlekérdezésű figyelem jövője

Az MQA megállapította, hogy a redundáns kulcs-/értékfejeket csekély károsodás nélkül le lehet vágni, és ez a betekintés mostanra szinte minden gyors következtetés LLM-et alakít. A terület nagyrészt a Grouped-Query Attention (GQA) felé közeledett, amelyet a Llama 2/3-ban és sok másban használnak, és amely egy helyett néhány KV-csoportot használ a minőség helyreállítására, miközben megtartja a gyorsulás nagy részét. A jövőbeni munka ezeket az ötleteket ötvözi a KV-gyorsítótár-tömörítéssel, kvantálással és több látens figyelemel, hogy hosszabb kontextusokat és olcsóbb kiszolgálást biztosítson.

Valós megvalósítás

A tokenről token generálás felgyorsítása a csevegési asszisztensekben, ahol a KV gyorsítótár, nem pedig a nyers számítás korlátozza az átviteli sebességet.

Google PaLM-je, amely a többlekérdezés-figyelmet használta a hatékony nagyszabású következtetések lehetővé tételére.

Sok egyidejű felhasználó kiszolgálása egyetlen GPU-n a kérésenkénti KV gyorsítótár szűkítésével.

Grouped-Query Attention a Llama 2 70B-ben és a Llama 3-ban, egy közvetlen leszármazott, amely egyensúlyban tartja az MQA sebességét a teljes figyelem minőségével.

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Csoportos lekérdezés Figyelem

Gyakran ismételt kérdések

What is Multi-Query Attention?

A Multi-Query Attention (MQA) a transzformátor figyelem memóriakímélő csavarja, amely egyetlen kulcs- és értékkészleten osztozik az összes figyelemfejen. Drámaian felgyorsítja a szöveggenerálást azáltal, hogy lecsökkenti a memóriát, amelyet a modellnek meg kell kevernie.

Miben osztozik a többlekérdezéses figyelem az összes figyelemfelkeltő között?

Az MQA fejenként külön lekérdezést tart, de egy kulcs- és egy értékprojekciót oszt meg az összes fejen.

Mi az az elsődleges szűk keresztmetszet, amelyet az MQA kezel az autoregresszív generálás során?

A nagy KV gyorsítótár újratöltése minden lépés sávszélességhez kötött; Az MQA csökkenti a gyorsítótárat a dekódolás felgyorsítása érdekében.

Körülbelül milyen tényezővel csökkenti az MQA a KV gyorsítótárat?

Mivel a kulcsok és értékek a H-fejekből eggyel zsugorodnak, a gyorsítótár hozzávetőlegesen a fejek számával csökken.

Mi az MQA használatának fő kompromisszuma?

A kulcsok és értékek megosztása enyhén csökkenti a reprezentációs kapacitást, ami kismértékű minőségromlást okoz nagy sebességnövekedésért cserébe.

Melyik változat áll a standard többfejes figyelem és az MQA között?

A Grouped-Query Attention (GQA) több KV csoportot használ egy helyett, egyensúlyban tartva a minőséget és a sebességet.