Увага на згрупований запит
Увага групового запиту (GQA) — це спосіб зменшити пам’ять, необхідну під час генерації тексту, дозволяючи кільком заголовкам запиту використовувати однакові заголовки ключа та значення.
Огляд
It makes large models much faster to serve with almost no quality loss.
Глибоке занурення
У стандартному шарі уваги з кількома головами кожна голова має власні запити, ключі та значення. Під час генерації ключі та значення для всіх попередніх маркерів кешуються («кеш KV»), тому модель не обчислює їх повторно. З великою кількістю голів і довгими контекстами цей кеш стає величезним і домінує в пропускній здатності пам’яті під час висновку. GQA, представлений дослідниками Google у 2023 році, групує заголовки запитів і надає кожній групі єдиний спільний набір заголовків ключів і значень. Якщо у вас є 32 головки запиту, але лише 8 груп KV, кеш KV зменшиться приблизно в чотири рази. Це між повною увагою кількох голов (кожна голова окремо) і увагою кількох запитів (один спільний KV для всіх голів), захоплюючи більшу частину швидкості MQA, зберігаючи якість, близьку до повної уваги. Llama 2 70B і багато пізніших моделей взяли його на озброєння.
Технічне розуміння
Якість уваги значною мірою залежить від наявності багатьох різних напрямків запиту, але вона допускає спільний доступ до ключів і значень. GQA використовує цю асиметрію: він зберігає всі заголовки запитів, але повторює кожну спільну заголовок KV для запитів у своїй групі. Економія приходить на висновок, де кеш KV є основним споживачем пропускної здатності пам'яті; менше головок KV означає менше даних для читання на згенерований маркер. Моделі часто коротко «підвищують кваліфікацію», щоб перетворити існуючу контрольну точку з кількома головками на контрольну точку GQA.
Стратегічний вплив
Швидкість і масштаб
Мовні робочі процеси можуть рухатися швидше без шкоди для узгодженості.
Доступ і охоплення
Це розширює доступ до різних мов і стилів спілкування.
Чіткіші рішення
Команди можуть витрачати більше часу на оцінювання, поки автоматизація справляється з повторенням.
Майбутнє уваги з груповими запитами
GQA тепер є стандартним за замовчуванням у моделях відкритої ваги, оскільки він чітко обмінює невелику вартість якості на великі перемоги в подачі. Очікуйте, що він буде все частіше поєднуватися з іншими прийомами ефективності, такими як FlashAttention, квантування KV-кешу та новіші схеми, такі як прихована увага з кількома головками, які ще більше стискають кеш. У міру того, як контекстні вікна збільшаться, контроль розміру KV-кешу залишатиметься основною проблемою проектування, а спільний доступ до заголовків у стилі GQA залишатиметься ключовим важелем.
Реалізація в реальному світі
Llama 2 70B і Llama 3 використовують GQA для обслуговування довгих контекстів із меншим кеш-пам’яттю KV
Зменшення пам’яті графічного процесора, щоб велика модель чату підходила до меншої кількості або дешевших прискорювачів
Прискорення генерації маркерів у робочих API, де пропускна здатність KV-кешу є вузьким місцем
Увімкнення більших розмірів пакетів для обслуговування багатьох користувачів одночасно без виснаження пам’яті
Ризики та огорожі
Галюциновані факти можуть непомітно входити у звіти, допоміжні потоки або результати досліджень.
Делікатність підказок може створити суперечливі результати для подібних запитів.
Конфіденційні текстові дані можуть бути розкриті, якщо контроль доступу слабкий.
Дорожня карта впровадження
Визначте вихідний формат, тон і стандарти якості перед розгортанням.
Якщо точність має значення, зв’яжіться з надійними джерелами.
Тримайте контрольну точку перевірки людьми для отримання високих ставок.
Відстежуйте моделі збоїв і регулярно перенавчайте підказки або робочі процеси.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped-Query Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Багатозапитова увага
Часті запитання
What is Grouped-Query Attention?
Увага групового запиту (GQA) — це спосіб зменшити пам’ять, необхідну під час генерації тексту, дозволяючи кільком заголовкам запиту використовувати однакові заголовки ключа та значення. Це робить великі моделі набагато швидшими для обслуговування без втрати якості.
Що ділиться між групою заголовків запитів у груповому запиті Attention?
GQA зберігає окремі заголовки запитів, але дозволяє кожній групі з них спільно використовувати один набір заголовків ключів і значень, зменшуючи кеш KV.
GQA найкраще описати як середину між якими двома крайнощами?
Мультиголовка дає кожній головці власний KV; мультизапит розділяє один KV для всіх голів; GQA знаходиться між кількома групами KV.
Яку частину висновків GQA здешевлює?
Економія проявляється під час генерації, коли читання кешу KV є домінуючою вартістю пропускної здатності пам’яті.
Якщо модель має 32 головки запиту та 8 груп KV, кеш KV зменшується приблизно на який коефіцієнт?
32 заголовки запитів, розділені на 8 спільних груп KV, дають приблизно чотириразове скорочення кешованих ключів і значень.
Чому GQA може зберегти більшу частину якості моделі, незважаючи на спільні головки KV?
Attention набагато краще переносить спільний доступ до ключів і значень, ніж втрату чітких напрямків запиту, тому GQA підтримує високу якість.