Taal AI-GIDS

Gegroepeerde query-aandacht

Grouped-Query Attention (GQA) is een manier om het benodigde geheugen tijdens het genereren van tekst te verkleinen door meerdere querykoppen dezelfde sleutel- en waardekoppen te laten delen.

2 min readLaatst bijgewerkt

Overzicht

It makes large models much faster to serve with almost no quality loss.

Diepe duik

In een standaard aandachtslaag met meerdere hoofden heeft elk hoofd zijn eigen query's, sleutels en waarden. Tijdens het genereren worden de sleutels en waarden voor alle voorgaande tokens in de cache opgeslagen (de 'KV-cache'), zodat het model deze niet opnieuw berekent. Met veel hoofden en lange contexten wordt deze cache enorm en domineert de geheugenbandbreedte op het moment van inferentie. GQA, geïntroduceerd door Google onderzoekers in 2023, groepeert de querykoppen en geeft elke groep een enkele gedeelde set sleutel- en waardekoppen. Als je 32 querykoppen hebt, maar slechts 8 KV-groepen, wordt de KV-cache grofweg verviervoudigd. Dit bevindt zich tussen volledige aandacht voor meerdere hoofden (elk hoofd afzonderlijk) en aandacht voor meerdere vragen (één gedeelde KV voor alle hoofden), waardoor het grootste deel van de snelheid van MQA wordt vastgelegd terwijl de kwaliteit dicht bij de volledige aandacht blijft. Llama 2 70B en veel latere modellen hebben het overgenomen.

Technisch inzicht

De kwaliteit van de aandacht is sterk afhankelijk van het hebben van veel verschillende zoekrichtingen, maar tolereert het delen van de sleutels en waarden. GQA maakt gebruik van deze asymmetrie: het behoudt alle query-heads, maar repliceert elke gedeelde KV-head over de queries in zijn groep. De besparingen komen voort uit de conclusie dat de KV-cache de belangrijkste verbruiker van geheugenbandbreedte is; minder KV-heads betekenen dat er minder gegevens per gegenereerd token moeten worden gelezen. Modellen worden vaak kortstondig 'opgetraind' om een ​​bestaand controlepunt met meerdere koppen om te zetten in een GQA-controlepunt.

Strategische impact

Speed and scale

Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.

Access and reach

Het breidt de toegang uit naar meerdere talen en communicatiestijlen.

Clearer decisions

Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.

De toekomst van aandacht voor gegroepeerde zoekopdrachten

GQA is nu een standaardstandaard in modellen met een open gewicht, omdat het kleine kwaliteitskosten netjes inruilt voor grote serveerwinsten. Verwacht dat het steeds meer zal worden gecombineerd met andere efficiëntietrucs zoals FlashAttention, KV-cache-kwantisering en nieuwere schema's zoals latente aandacht met meerdere hoofden die de cache nog verder comprimeren. Naarmate de contextvensters groter worden, zal het beheersen van de KV-cachegrootte een centraal ontwerpprobleem blijven, en zal het delen van hoofden in GQA-stijl een belangrijke hefboom blijven.

Implementatie in de echte wereld

Llama 2 70B en Llama 3 gebruiken GQA om lange contexten te bedienen met een kleinere KV-cache

Het verminderen van het GPU-geheugen, zodat een groot chatmodel op minder of goedkopere accelerators past

Het versnellen van het genereren van tokens per token in productie-API's waarbij KV-cachebandbreedte het knelpunt is

Maakt grotere batchgroottes mogelijk om veel gebruikers tegelijkertijd te bedienen zonder geheugen uit te putten

Risico's en vangrails

Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.

Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.

Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.

Implementatie routekaart

1

Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.

2

Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.

3

Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.

4

Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Aandacht voor meerdere zoekopdrachten

Frequently asked questions

What is Grouped-Query Attention?

Grouped-Query Attention (GQA) is een manier om het benodigde geheugen tijdens het genereren van tekst te verkleinen door meerdere querykoppen dezelfde sleutel- en waardekoppen te laten delen. Hierdoor zijn grote modellen veel sneller te serveren, met vrijwel geen kwaliteitsverlies.

Wat wordt er in Grouped-Query Attention gedeeld door een groep queryheads?

GQA houdt afzonderlijke querykoppen bij, maar laat elke groep één set sleutel- en waardekoppen delen, waardoor de KV-cache wordt verkleind.

GQA kan het beste worden omschreven als een middenweg tussen welke twee uitersten?

Multi-head geeft elk hoofd zijn eigen KV; multi-query deelt één KV voor alle heads; GQA zit er tussenin met een paar KV-groepen.

Welk deel van de gevolgtrekking maakt GQA vooral goedkoper?

De besparingen komen tot uiting tijdens het genereren, waarbij het lezen van de KV-cache de dominante kosten voor geheugenbandbreedte is.

Als een model 32 querykoppen en 8 KV-groepen heeft, wordt de KV-cache met ongeveer welke factor verminderd?

32 querykoppen gedeeld door 8 gedeelde KV-groepen geven ruwweg een viervoudige reductie in het aantal in de cache opgeslagen sleutels en waarden.

Waarom kan GQA het grootste deel van de kwaliteit van het model behouden ondanks het delen van KV-hoofden?

Attention tolereert het delen van sleutels en waarden veel beter dan het verlies van verschillende zoekrichtingen, dus GQA houdt de kwaliteit hoog.