Език AI РЪКОВОДСТВО

Внимание за множество заявки

Multi-Query Attention (MQA) е спестяващ памет обрат на трансформиращото внимание, който споделя един набор от ключове и стойности във всички глави на вниманието.

2 min readПоследна актуализация

Преглед

It dramatically speeds up text generation by shrinking the memory the model must shuffle around.

Дълбоко гмуркане

Стандартното внимание на няколко глави дава на всяка глава свои собствени заявки, ключови и стойностни прогнози. По време на генерирането ключовете и стойностите за всички минали токени трябва да се кешират и презареждат на всяка стъпка — този KV кеш се превръща в основното пречка, тъй като четенето му от паметта е по-бавно от самата математика. Multi-Query Attention, предложен от Noam Shazeer през 2019 г., поддържа отделни проекции на заявки за глава, но свива ключовете и стойностите до една споделена глава. Това свива KV кеша с фактор, равен на броя на главите, понякога 8x до 64x по-малък. Резултатът е много по-бързо авторегресивно декодиране и по-лек отпечатък на паметта, само със скромно понижаване на качеството. Средната позиция, Grouped-Query Attention, балансира компромиса.

Техническа информация

В MQA теглата на заявките все още произвеждат H отделни вектори на заявки, но една проекция на ключ и проекция на единична стойност се споделят във всички заглавия. Всяка глава изчислява вниманието, използвайки своя собствена заявка срещу едни и същи ключове и стойности. Тъй като кешираните K и V тензори вече не се мащабират с броя на главите, честотната лента на паметта по време на декодиране пада рязко - и честотната лента, а не изчислението, е това, което определя скоростта на генериране на модерни ускорители.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на вниманието към множество заявки

MQA установи, че можете да отстраните излишните заглавия ключ/стойност с малко вреда и това прозрение сега оформя почти всеки LLM с бързо извеждане. Полето до голяма степен се сближи с вниманието на групирани заявки (GQA), използвано в Llama 2/3 и много други, което използва няколко KV групи, а не една, за да възстанови качеството, като същевременно запазва по-голямата част от ускорението. Бъдещата работа съчетава тези идеи с KV-кеш компресия, квантуване и мулти-латентно внимание, за да прокара по-дълги контексти и по-евтино обслужване.

Внедряване в реалния свят

Ускоряване на генерирането токен по токен в асистентите за чат, където KV кешът, а не суровото изчисление, ограничава пропускателната способност.

PaLM на Google, който използва Multi-Query Attention, за да даде възможност за ефективно широкомащабно заключение.

Обслужване на много едновременни потребители на един GPU чрез свиване на KV кеш паметта за всяка заявка.

Внимание с групирани заявки в Llama 2 70B и Llama 3, пряк наследник, балансиращ скоростта на MQA с пълно внимание.

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Групирана заявка внимание

Frequently asked questions

What is Multi-Query Attention?

Multi-Query Attention (MQA) е спестяващ памет обрат на трансформиращото внимание, който споделя един набор от ключове и стойности във всички глави на вниманието. Той драматично ускорява генерирането на текст чрез свиване на паметта, която моделът трябва да разбърква.

Какво споделя вниманието на множество заявки между всички глави на вниманието?

MQA поддържа отделни заявки за глава, но споделя една ключова проекция и една стойностна проекция за всички глави.

Какво е основното тясно място, което MQA адресира по време на авторегресивно генериране?

Презареждане на големия KV кеш, всяка стъпка е свързана с честотната лента; MQA свива този кеш, за да ускори декодирането.

Приблизително с какъв фактор MQA свива KV кеша?

Тъй като ключовете и стойностите се свиват от H глави до една, кешът се свива приблизително с броя на главите.

Какъв е основният компромис от използването на MQA?

Споделянето на ключове и стойности леко намалява капацитета за представяне, причинявайки малко понижаване на качеството в замяна на големи печалби в скоростта.

Кой вариант се намира между стандартното многостранно внимание и MQA?

Grouped-Query Attention (GQA) използва няколко KV групи вместо една, като балансира качеството и скоростта.