Мова AI GUIDE

Багатозапитова увага

Multi-Query Attention (MQA) — це зміна трансформації уваги, що економить пам’ять, яка використовує один набір ключів і значень для всіх головок уваги.

2 хвилини читанняОстаннє оновлення

Огляд

It dramatically speeds up text generation by shrinking the memory the model must shuffle around.

Глибоке занурення

Стандартна увага кількох голов дає кожній голові власний запит, ключ і проекцію цінності. Під час генерації ключі та значення для всіх минулих токенів потрібно кешувати та перезавантажувати на кожному кроці — цей кеш KV стає головним вузьким місцем, оскільки його читання з пам’яті відбувається повільніше, ніж сама математика. Multi-Query Attention, запропонований Ноамом Шазіром у 2019 році, зберігає окремі прогнози запитів для кожної голови, але згортає ключі та значення до однієї спільної голови. Це зменшує кеш KV на коефіцієнт, що дорівнює кількості голів, іноді від 8 до 64 разів менше. Результатом є набагато швидше авторегресійне декодування та менший обсяг пам’яті з лише помірним зниженням якості. Золотий шлях, Grouped-Query Attention, врівноважує компроміс.

Технічне розуміння

У MQA ваги запиту все ще створюють H окремих векторів запиту, але одна проекція ключа та проекція єдиного значення використовуються для всіх заголовків. Кожна голова обчислює увагу, використовуючи власний запит щодо однакових ключів і значень. Оскільки кешовані тензори K і V більше не масштабуються залежно від кількості голів, пропускна здатність пам’яті під час декодування різко падає — і пропускна здатність, а не обчислення, є тим, що визначає швидкість генерації на сучасних прискорювачах.

Стратегічний вплив

Швидкість і масштаб

Мовні робочі процеси можуть рухатися швидше без шкоди для узгодженості.

Доступ і охоплення

Це розширює доступ до різних мов і стилів спілкування.

Чіткіші рішення

Команди можуть витрачати більше часу на оцінювання, поки автоматизація справляється з повторенням.

Майбутнє багатозапитової уваги

MQA встановив, що ви можете скоротити надлишкові ключі/значення голови з невеликою шкодою, і це розуміння тепер формує майже кожен швидкий висновок LLM. Поле значною мірою зблизилося з груповим запитом (GQA), який використовується в Llama 2/3 та багатьох інших, який використовує декілька груп KV, а не одну, щоб відновити якість, зберігаючи більшу частину прискорення. Майбутня робота поєднує ці ідеї зі стисненням KV-кешу, квантуванням і мультилатентною увагою, щоб просувати довші контексти та дешевше обслуговування.

Реалізація в реальному світі

Прискорення генерації маркерів у помічниках чату, де кеш KV, а не необроблені обчислення, обмежує пропускну здатність.

PaLM Google, який використовував Multi-Query Attention для ефективного широкомасштабного висновку.

Обслуговування багатьох одночасних користувачів на одному графічному процесорі шляхом зменшення кеш-пам’яті KV для кожного запиту.

Увага згрупованого запиту в Llama 2 70B і Llama 3, прямий нащадок, який балансує швидкість MQA з якістю повної уваги.

Ризики та огорожі

Галюциновані факти можуть непомітно входити у звіти, допоміжні потоки або результати досліджень.

Делікатність підказок може створити суперечливі результати для подібних запитів.

Конфіденційні текстові дані можуть бути розкриті, якщо контроль доступу слабкий.

Дорожня карта впровадження

1

Визначте вихідний формат, тон і стандарти якості перед розгортанням.

2

Якщо точність має значення, зв’яжіться з надійними джерелами.

3

Тримайте контрольну точку перевірки людьми для отримання високих ставок.

4

Відстежуйте моделі збоїв і регулярно перенавчайте підказки або робочі процеси.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Увага на згрупований запит

Часті запитання

What is Multi-Query Attention?

Multi-Query Attention (MQA) — це зміна трансформації уваги, що економить пам’ять, яка використовує один набір ключів і значень для всіх головок уваги. Це значно прискорює генерацію тексту, зменшуючи пам’ять, яку модель має перетасувати.

Що поділяє увага на основі кількох запитів між усіма головами уваги?

MQA зберігає окремі запити для кожної голови, але ділиться одним ключовим прогнозом і одним значенням для всіх голов.

Яке основне вузьке місце, яке MQA вирішує під час авторегресійної генерації?

Перезавантаження великого кешу KV на кожному кроці залежить від пропускної здатності; MQA зменшує цей кеш, щоб пришвидшити декодування.

Приблизно за якого фактора MQA зменшує кеш KV?

Оскільки ключі та значення згортаються з H голів до однієї, кеш зменшується приблизно на кількість голів.

Який основний компроміс використання MQA?

Спільне використання ключів і значень дещо зменшує репрезентативну здатність, спричиняючи невелике зниження якості в обмін на значне збільшення швидкості.

Який варіант знаходиться між стандартною увагою кількох голов і MQA?

Увага з групового запиту (GQA) використовує кілька груп KV замість однієї, збалансовуючи якість і швидкість.