SmoothQuant и квантуване за активиране
SmoothQuant е техника, която прави възможно компресирането на големи езикови модели до 8-битови цели числа както за тегла, така и за активации без повторно обучение.
Преглед
It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.
Дълбоко гмуркане
Когато свиете модел от 16-битови плаващи до 8-битови цели числа, теглата се компресират лесно, но активирането е проблем: определени канали носят стойности от 10 до 100 пъти по-големи от останалите и принуждаването им към мрежа с груби цели числа разрушава точността. SmoothQuant, въведен от Xiao et al. през 2022 г. отбелязва, че теглата са плавни и лесни за квантуване, докато активациите са пикантни. Така че математически мигрира трудността: разделя каналите за активиране по скала за всеки канал и умножава съответните тегла по същата скала. Двете операции се отменят, оставяйки изхода на модела непроменен, но сега и двата тензора се намират в приятелски диапазони. Резултатът е W8A8 (8-битови тегла и активации) извод с почти нулева загуба на точност и грубо 2 пъти ускоряване и спестяване на памет.
Техническа информация
Основният трик е коефициент на изглаждане на канал s, изчислен като s = max(|X|)^alpha / max(|W|)^(1-alpha). Активациите се мащабират с 1/s и теглата с s, така че матричният продукт XW се запазва. Тъй като мащабирането се абсорбира офлайн в теглата на предишния слой или в слята операция, то добавя нулеви разходи за изпълнение. Алфа хиперпараметърът (често 0,5) контролира колко извънредно натоварване се измества от активации към тегла.
Стратегическо въздействие
Cost and budget
Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.
Clearer decisions
Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.
Quality control
По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.
Бъдещето на SmoothQuant и Activation Quantization
SmoothQuant установи, че отклоненията при активиране са мигриращи, а не неизбежни, и тази идея сега е в основата на производствените INT8 и FP8 обслужване. Очаквайте изглаждането да бъде комбинирано с по-фини схеми като квантуване по група, научено мащабиране и изследване на 4-битово активиране (напр. методи за отчитане на отклонения). Тъй като хардуерът на FP8 (Hopper, Blackwell) узрява, балансирането в стил на изглаждане ще продължи да се вписва в компилатор и тръбопроводи на машина за изводи, така че квантуването остава почти безплатно.
Внедряване в реалния свят
Обслужване на 70B-параметър LLM при W8A8 на по-малко GPU чрез намаляване наполовина както на паметта, така и на разходите за умножение на матрици
Активиране на INT8 извод на NVIDIA Hopper/Blackwell тензорни ядра, които естествено ускоряват 8-битовата целочислена математика
Внедряване на модели за чат в облачни крайни точки с ограничени разходи, където удвояването на пропускателната способност директно намалява сметката за токен
Компресиране на трансформаторни енкодери за реч или превод на устройството, където 8-битовите ядра работят по-бързо и по-студено
Рискове и предпазни огради
Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.
Разходите за инфраструктура и поддръжка често се подценяват.
Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.
Пътна карта за изпълнение
Определете целите за латентност, качество и разходи преди внедряването.
Бенчмарк при реалистични условия на натоварване и данни.
Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.
Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SmoothQuant and Activation Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Управление на активирането и инженеринг на представителството
Frequently asked questions
What is SmoothQuant and Activation Quantization?
SmoothQuant е техника, която прави възможно компресирането на големи езикови модели до 8-битови цели числа както за тегла, така и за активации без повторно обучение. Има значение, тъй като активациите в големите модели съдържат екстремни отклонения, които обикновено развалят математиката с ниска точност, а SmoothQuant ги опитомява.
Към какъв проблем конкретно се отнася SmoothQuant при извод с ниска точност?
SmoothQuant е насочен към големите извънредни стойности, които се появяват в определени канали за активиране, които иначе унищожават точността, когато активациите се квантуват до 8 бита.
Как SmoothQuant прави активирането по-лесно за квантуване?
Той разделя каналите за активиране по скала за всеки канал и умножава съответстващите тегла по тази скала, така че продуктът остава непроменен, но двата тензора стават по-лесни за квантуване.
Какво означава обозначението W8A8?
W8A8 обозначава 8-битово квантуване както за тегла (W), така и за активации (A), режимът SmoothQuant позволява с минимална загуба на точност.
Защо мащабирането на SmoothQuant не добавя по същество допълнителни разходи по време на изпълнение?
Изглаждащите скали се сгъват в теглата на предходния слой или в слята операция преди време, така че не се извършва допълнително изчисление при извода.
Каква роля играе алфа хиперпараметърът в SmoothQuant?
Алфа (обикновено 0,5) балансира коефициента на изглаждане, решавайки каква част от трудността на квантуване се премества от активациите към теглата.