SmoothQuant и активационное квантование
SmoothQuant — это метод, который позволяет сжимать большие языковые модели до 8-битных целых чисел как для весов, так и для активаций без повторного обучения.
Обзор
It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.
Глубокое погружение
Когда вы сжимаете модель от 16-битных чисел с плавающей запятой до 8-битных целых чисел, веса легко сжимаются, но с активацией возникают проблемы: некоторые каналы несут значения в 10–100 раз больше, чем остальные, и принуждение их к грубой целочисленной сетке снижает точность. SmoothQuant, представленный Сяо и др. в 2022 году отмечает, что веса плавные и легко поддаются квантованию, в то время как активации резкие. Таким образом, он математически переносит сложность: он делит каналы активации по шкале каждого канала и умножает соответствующие веса на ту же шкалу. Две операции отменяются, оставляя выходные данные модели неизменными, но теперь оба тензора находятся в дружественных диапазонах. Результатом является вывод W8A8 (8-битные веса и активации) с почти нулевой потерей точности и примерно двукратным ускорением и экономией памяти.
Техническая информация
Основной трюк — это коэффициент сглаживания для каждого канала, вычисляемый как s = max(|X|)^alpha / max(|W|)^(1-alpha). Активации масштабируются на 1/s, а веса на s, поэтому матричный продукт XW сохраняется. Поскольку масштабирование в автономном режиме поглощается весами предыдущего слоя или объединенной операцией, оно не добавляет никаких затрат во время выполнения. Альфа-гиперпараметр (часто 0,5) контролирует, насколько выбросы нагрузки переходят от активаций к весам.
Стратегическое воздействие
Стоимость и бюджет
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Более четкие решения
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Контроль качества
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
Будущее SmoothQuant и активационного квантования
SmoothQuant установил, что выбросы активации являются скорее переносимыми, чем неизбежными, и эта идея теперь лежит в основе обслуживания INT8 и FP8. Ожидайте, что сглаживание будет сочетаться с более детальными схемами, такими как квантование для каждой группы, обученное масштабирование и исследование 4-битной активации (например, методы с учетом выбросов). По мере развития аппаратного обеспечения FP8 (Hopper, Blackwell) балансировка в стиле сглаживания будет и дальше внедряться в конвейеры компилятора и механизма вывода, поэтому квантование останется практически бесплатным.
Реальная реализация
Обслуживание LLM с 70B параметрами на W8A8 на меньшем количестве графических процессоров за счет сокращения вдвое затрат на память и умножение матрицы.
Включение вывода INT8 на тензорных ядрах NVIDIA Hopper/Blackwell, которые естественным образом ускоряют 8-битные целочисленные вычисления.
Развертывание моделей чата на облачных конечных точках с ограниченными затратами, где удвоение пропускной способности напрямую снижает расходы на каждый токен.
Сжатие преобразовательных кодеров для речи или перевода на устройстве, где 8-битные ядра работают быстрее и холоднее.
Риски и ограничения
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Дорожная карта реализации
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SmoothQuant and Activation Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Управление активацией и инженерия представления
Часто задаваемые вопросы
What is SmoothQuant and Activation Quantization?
SmoothQuant — это метод, который позволяет сжимать большие языковые модели до 8-битных целых чисел как для весов, так и для активаций без повторного обучения. Это важно, поскольку активации в больших моделях содержат резкие выбросы, которые обычно нарушают математические вычисления низкой точности, и SmoothQuant их укрощает.
Какую проблему конкретно решает SmoothQuant при выводе низкой точности?
SmoothQuant нацелен на большие значения выбросов, которые появляются в определенных каналах активации, которые в противном случае снижают точность, когда активации квантуются до 8 бит.
Как SmoothQuant упрощает квантование активаций?
Он делит каналы активации по шкале каждого канала и умножает соответствующие веса на эту шкалу, поэтому произведение не меняется, но оба тензора становится легче квантовать.
Что означает обозначение W8A8?
W8A8 обозначает 8-битное квантование как для весов (W), так и для активаций (A), режим SmoothQuant обеспечивает минимальную потерю точности.
Почему масштабирование SmoothQuant практически не увеличивает накладные расходы во время выполнения?
Шкалы сглаживания заранее складываются в веса предыдущего слоя или объединенную операцию, поэтому при выводе не происходит никаких дополнительных вычислений.
Какую роль играет альфа-гиперпараметр в SmoothQuant?
Альфа (обычно 0,5) уравновешивает коэффициент сглаживания, определяя, какая часть сложности квантования переносится с активаций на веса.