Технічний КЕРІВНИЦТВО

SmoothQuant і квантування активації

SmoothQuant — це техніка, яка дає змогу стискати великі мовні моделі до 8-бітних цілих чисел як для ваг, так і для активацій без повторного навчання.

2 хвилини читанняОстаннє оновлення

Огляд

It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.

Глибоке занурення

Коли ви зменшуєте модель від 16-бітних чисел з плаваючою точкою до 8-бітних цілих, ваги легко стискаються, але активація створює проблеми: певні канали передають значення в 10-100 разів більші за решта, і примусове розміщення їх у грубій цілочисельній сітці руйнує точність. SmoothQuant, представлений Xiao et al. у 2022 році зауважує, що ваги є плавними та їх легко квантувати, тоді як активації різкі. Таким чином, він математично змінює складність: він ділить канали активації за шкалою для кожного каналу та множить відповідні ваги на ту саму шкалу. Дві операції скасовуються, залишаючи вихід моделі незмінним, але тепер обидва тензори знаходяться в дружніх діапазонах. Результатом є висновок W8A8 (8-бітні ваги та активації) з майже нульовою втратою точності та приблизно 2-кратним прискоренням і економією пам’яті.

Технічне розуміння

Основний трюк — коефіцієнт згладжування для кожного каналу s, який обчислюється як s = max(|X|)^alpha / max(|W|)^(1-alpha). Активації масштабуються на 1/с, а ваги на s, тому матричний добуток XW зберігається. Оскільки масштабування поглинається офлайн у ваги попереднього шару або об’єднану операцію, це додає нульову вартість виконання. Альфа-гіперпараметр (часто 0,5) контролює, наскільки викид зміщується від активацій до ваг.

Стратегічний вплив

Вартість і бюджет

Архітектурні рішення збільшують продуктивність і експлуатаційні витрати протягом багатьох років.

Чіткіші рішення

Технічна освіта допомагає командам вибрати правильний стек, а не лише найновіший.

Контроль якості

Кращий інженерний вибір зменшує проблеми з надійністю у виробництві.

Майбутнє SmoothQuant і квантування активації

SmoothQuant встановив, що викиди активації можна перенести, а не уникнути, і ця ідея тепер лежить в основі обслуговування виробничих INT8 і FP8. Очікуйте, що згладжування поєднується з більш детальними схемами, такими як квантування по групах, навчене масштабування та дослідження 4-бітної активації (наприклад, методи з урахуванням викидів). Оскільки апаратне забезпечення FP8 (Hopper, Blackwell) розвивається, балансування у стилі згладжування продовжуватиме запікатися в конвеєри компілятора та механізму виведення, тому квантування залишається майже вільним.

Реалізація в реальному світі

Обслуговування 70B-параметрів LLM на W8A8 на меншій кількості графічних процесорів за рахунок зменшення вдвічі вартості пам’яті та множення матриці

Увімкнення висновку INT8 на тензорних ядрах NVIDIA Hopper/Blackwell, які прискорюють 8-розрядну цілочисельну математику

Розгортання моделей чату на хмарних кінцевих точках з обмеженими витратами, де подвоєння пропускної здатності безпосередньо скорочує рахунок за токен

Стиснення трансформаторних кодерів для мовлення або перекладу на пристрої, де 8-розрядні ядра працюють швидше та холодніше

Ризики та огорожі

Оптимізація одного тесту може приховати ширші слабкі сторони системи.

Витрати на інфраструктуру та обслуговування часто недооцінюються.

Прогалини в безпеці та спостережуваності можуть зростати в міру ускладнення систем.

Дорожня карта впровадження

1

Визначте цільові показники затримки, якості та вартості перед впровадженням.

2

Тест за реалістичних умов навантаження та даних.

3

Моніторинг інструментів на наявність помилок, дрейфу та впливу користувача.

4

Перед масштабуванням підготуйте шляхи відкату та реагування на інциденти.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SmoothQuant and Activation Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Керування активацією та розробка представлення

Часті запитання

What is SmoothQuant and Activation Quantization?

SmoothQuant — це техніка, яка дає змогу стискати великі мовні моделі до 8-бітних цілих чисел як для ваг, так і для активацій без повторного навчання. Це важливо, оскільки активації у великих моделях містять екстремальні викиди, які зазвичай руйнують математику з низькою точністю, і SmoothQuant приборкує їх.

Яку проблему конкретно вирішує SmoothQuant у логічному висновку з низькою точністю?

SmoothQuant націлений на великі значення викидів, які з’являються в певних каналах активації, які інакше руйнують точність, коли активації квантуються до 8 біт.

Як SmoothQuant полегшує квантування активацій?

Він ділить канали активації за шкалою для кожного каналу та множить відповідні ваги на цю шкалу, тому добуток залишається незмінним, але обидва тензори легше квантувати.

Що означає позначення W8A8?

W8A8 позначає 8-бітне квантування як для ваг (W), так і для активацій (A), режим SmoothQuant дозволяє з мінімальною втратою точності.

Чому масштабування SmoothQuant практично не додає накладних витрат на виконання?

Шкали згладжування складаються до ваг попереднього шару або злитої операції заздалегідь, тому під час висновку не відбувається додаткових обчислень.

Яку роль відіграє альфа-гіперпараметр у SmoothQuant?

Альфа (зазвичай 0,5) врівноважує коефіцієнт згладжування, вирішуючи, яка частина складності квантування переноситься з активацій на ваги.