Nyelvi AI ÚTMUTATÓ

Csoportos lekérdezés Figyelem

A Grouped-Query Attention (GQA) egy módja annak, hogy csökkentse a szöveggeneráláshoz szükséges memóriát azáltal, hogy több lekérdezőfejet megoszt ugyanazon a kulcs- és értékfejeken.

2 perc olvasásUtoljára frissítve

Áttekintés

It makes large models much faster to serve with almost no quality loss.

Mély merülés

A szabványos többfejes figyelemrétegben minden fejnek saját lekérdezései, kulcsai és értékei vannak. A generálás során az összes korábbi token kulcsai és értékei gyorsítótárazásra kerülnek (a „KV gyorsítótár”), így a modell nem számítja újra őket. Sok fejjel és hosszú kontextussal ez a gyorsítótár óriásivá válik, és uralja a memória sávszélességét a következtetési időben. A Google kutatók által 2023-ban bevezetett GQA csoportosítja a lekérdezési fejeket, és minden csoportnak egyetlen megosztott kulcs- és értékfejkészletet ad. Ha 32 lekérdezőfeje van, de csak 8 KV csoportja, a KV gyorsítótár nagyjából négyszeresére csökken. Ez a teljes többfejes figyelem (minden fej külön) és a több lekérdezés (egy megosztott KV az összes fejhez) között helyezkedik el, megragadva az MQA sebességének nagy részét, miközben a minőséget a teljes figyelem közelében tartja. A Llama 2 70B és sok későbbi modell alkalmazta.

Technikai betekintés

A figyelem minősége nagymértékben függ attól, hogy sok különböző lekérdezési irány van, de tolerálja a kulcsok és értékek megosztását. A GQA kihasználja ezt az aszimmetriát: megtartja az összes lekérdezési fejet, de minden megosztott KV-fejet replikál a csoportjában lévő lekérdezések között. A megtakarítás abból a következtetésből adódik, hogy a KV gyorsítótár a memória sávszélességének fő fogyasztója; kevesebb KV-fej kevesebb adatot jelent generált tokenenként. A modelleket gyakran rövid időre „felkészítik”, hogy egy meglévő többfejes ellenőrzőpontot GQA-vá alakítsanak át.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A csoportos lekérdezés figyelem jövője

A GQA ma már a nyitott súlyú modellek alapértelmezése, mert apró minőségi költséget jelent a nagy adag nyereményekre. Várhatóan egyre inkább kombinálódik más hatékonysági trükkökkel, mint például a FlashAttention, a KV-gyorsítótár kvantálása és az újabb sémák, mint például a többfejes látens figyelem, amelyek még tovább tömörítik a gyorsítótárat. A környezeti ablakok növekedésével a KV-gyorsítótár méretének szabályozása központi tervezési probléma marad, és a GQA-stílusú fejmegosztás továbbra is kulcsfontosságú kar marad.

Valós megvalósítás

A Llama 2 70B és a Llama 3 GQA használatával hosszabb kontextusok kiszolgálására kisebb KV gyorsítótárral

Csökkenti a GPU-memóriát, így a nagy chat-modell kevesebb vagy olcsóbb gyorsítóval is elfér

A tokenről token generálás felgyorsítása az éles API-kban, ahol a KV-cache sávszélesség jelenti a szűk keresztmetszetet

Nagyobb kötegméretek engedélyezése több felhasználó egyidejű kiszolgálásához a memória kimerülése nélkül

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Több lekérdezés figyelem

Gyakran ismételt kérdések

What is Grouped-Query Attention?

A Grouped-Query Attention (GQA) egy módja annak, hogy csökkentse a szöveggeneráláshoz szükséges memóriát azáltal, hogy több lekérdezőfejet megoszt ugyanazon a kulcs- és értékfejeken. Sokkal gyorsabbá teszi a nagyméretű modellek kiszolgálását, szinte minőségromlás nélkül.

A Csoportos lekérdezés Figyelem funkcióban mi van megosztva a lekérdezési fejek csoportja között?

A GQA külön lekérdezési fejeket tart, de lehetővé teszi, hogy mindegyik csoport megosszon egy kulcs- és értékfejkészletet, csökkentve ezzel a KV gyorsítótárat.

A GQA melyik két véglet közötti középútként írható le leginkább?

A Multi-head minden fejnek saját KV-t ad; a több lekérdezés egy KV-t oszt meg minden fej számára; A GQA között van néhány KV csoport.

A következtetés melyik részét teszi elsősorban olcsóbbá a GQA?

A megtakarítások generálási időben jelentkeznek, ahol a KV gyorsítótár olvasása a domináns memória-sávszélesség költség.

Ha egy modellnek 32 lekérdezési feje és 8 KV csoportja van, akkor a KV gyorsítótár nagyjából milyen tényezővel csökken?

32 lekérdezési fej osztva 8 megosztott KV csoporttal, nagyjából négyszeresére csökkenti a gyorsítótárazott kulcsokat és értékeket.

Miért tudja a GQA megőrizni a modell minőségének nagy részét annak ellenére, hogy megosztja a KV-fejeket?

A figyelem sokkal jobban tolerálja a kulcsok és értékek megosztását, mint az eltérő lekérdezési irányok elvesztését, így a GQA magas színvonalon tartja a minőséget.