Групирана заявка внимание
Grouped-Query Attention (GQA) е начин за свиване на паметта, необходима по време на генериране на текст, като позволите на няколко глави на заявки да споделят едни и същи глави на ключ и стойност.
Преглед
It makes large models much faster to serve with almost no quality loss.
Дълбоко гмуркане
В стандартен слой за внимание с няколко глави, всяка глава има свои собствени заявки, ключове и стойности. По време на генерирането ключовете и стойностите за всички предишни токени се кешират („KV кеш“), така че моделът да не ги изчислява отново. С много заглавия и дълги контексти този кеш става огромен и доминира честотната лента на паметта по време на извод. GQA, въведен от изследователите на Google през 2023 г., групира заглавията на заявките и дава на всяка група единичен споделен набор от заглавия на ключове и стойности. Ако имате 32 глави на заявка, но само 8 KV групи, KV кешът се свива приблизително четири пъти. Това се намира между пълното внимание на няколко глави (всяка глава отделна) и вниманието на множество заявки (един споделен KV за всички глави), улавяйки по-голямата част от скоростта на MQA, като същевременно поддържа качеството близо до пълното внимание. Llama 2 70B и много по-късни модели го приеха.
Техническа информация
Качеството на вниманието зависи силно от наличието на много различни посоки на заявки, но толерира споделянето на ключове и стойности. GQA използва тази асиметрия: запазва всички глави на заявки, но репликира всяка споделена KV глава в заявките в своята група. Спестяванията идват от заключението, че KV кешът е основният потребител на честотната лента на паметта; по-малко KV глави означават по-малко данни за четене на генериран токен. Моделите често се „обучават“ за кратко, за да преобразуват съществуваща контролна точка с много глави в GQA.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на вниманието при групирани заявки
GQA вече е стандартна настройка по подразбиране в моделите с отворено тегло, защото чисто търгува с малка цена за качество за големи печалби при сервиране. Очаквайте да се комбинира все повече с други трикове за ефективност като FlashAttention, квантуване на KV-кеша и по-нови схеми като латентно внимание с множество глави, които компресират кеша още повече. С нарастването на контекстните прозорци, контролирането на размера на KV-кеша ще остане централен проблем на дизайна, а споделянето на главата в стил GQA ще остане ключов лост.
Внедряване в реалния свят
Llama 2 70B и Llama 3 използват GQA за обслужване на дълги контексти с по-малък KV кеш
Намаляване на GPU паметта, така че голям модел за чат да пасва на по-малко или по-евтини ускорители
Ускоряване на генерирането на токен по токен в производствени API, където честотната лента на KV-кеша е тясното място
Разрешаване на по-големи размери на партиди за обслужване на много потребители едновременно без изчерпване на паметта
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped-Query Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Внимание за множество заявки
Frequently asked questions
What is Grouped-Query Attention?
Grouped-Query Attention (GQA) е начин за свиване на паметта, необходима по време на генериране на текст, като позволите на няколко глави на заявки да споделят едни и същи глави на ключ и стойност. Това прави големите модели много по-бързи за обслужване без почти никаква загуба на качество.
В Grouped-Query Attention какво се споделя между група от заглавия на заявки?
GQA поддържа отделни глави на заявки, но позволява на всяка група от тях да споделя един набор от глави на ключове и стойности, свивайки KV кеша.
GQA се описва най-добре като средно положение между кои две крайности?
Multi-head дава на всяка глава свой собствен KV; multi-query споделя един KV за всички глави; GQA се намира между няколко KV групи.
Каква част от заключенията GQA основно прави по-евтина?
Спестяванията се показват по време на генериране, където четенето на KV кеша е доминиращият разход за честотна лента на паметта.
Ако един модел има 32 глави на заявки и 8 KV групи, KV кешът се намалява с приблизително какъв фактор?
32 глави на заявки, разделени на 8 споделени KV групи, дават грубо четирикратно намаление на кешираните ключове и стойности.
Защо GQA може да запази повечето от качеството на модела въпреки споделянето на KV глави?
Вниманието толерира споделянето на ключове и стойности много по-добре, отколкото толерира загубата на различни посоки на заявката, така че GQA поддържа високо качество.