SmoothQuant i kwantyzacja aktywacyjna
SmoothQuant to technika umożliwiająca kompresję dużych modeli językowych do 8-bitowych liczb całkowitych zarówno dla wag, jak i aktywacji, bez konieczności ponownego uczenia.
Przegląd
It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.
Głębokie nurkowanie
Kiedy zmniejszasz model z 16-bitowych liczb zmiennoprzecinkowych do 8-bitowych liczb całkowitych, wagi łatwo się kompresują, ale aktywacje są kłopotliwe: niektóre kanały przenoszą wartości od 10 do 100 razy większe niż pozostałe, a wciskanie ich w grubą siatkę liczb całkowitych niszczy dokładność. SmoothQuant, wprowadzony przez Xiao i in. w 2022 r. zauważa, że wagi są gładkie i łatwe do skwantowania, a aktywacje są kolczaste. W ten sposób matematycznie przenosi się trudność: dzieli kanały aktywacji według skali dla poszczególnych kanałów i mnoży odpowiadające im wagi przez tę samą skalę. Obie operacje anulują się, pozostawiając wynik modelu niezmieniony, ale teraz oba tensory znajdują się w przyjaznych zakresach. Rezultatem jest wnioskowanie W8A8 (8-bitowe wagi i aktywacje) z niemal zerową utratą dokładności i około 2-krotnym przyspieszeniem i oszczędnością pamięci.
Wgląd techniczny
Podstawową sztuczką jest współczynnik wygładzania s dla każdego kanału obliczany jako s = max(|X|)^alfa / max(|W|)^(1-alfa). Aktywacje są skalowane przez 1/s, a wagi przez s, więc iloczyn macierzy XW zostaje zachowany. Ponieważ skalowanie jest absorbowane w trybie offline przez wagi poprzedniej warstwy lub operację połączoną, dodaje to zerowy koszt czasu wykonania. Hiperparametr alfa (często 0,5) kontroluje, jak bardzo obciążenie odstające przesuwa się z aktywacji na wagi.
Wpływ strategiczny
Koszt i budżet
Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.
Jaśniejsze decyzje
Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.
Kontrola jakości
Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.
Przyszłość SmoothQuant i kwantyzacji aktywacyjnej
W firmie SmoothQuant ustalono, że wartości odstające dotyczące aktywacji można raczej migrować, a nie nieuniknić, i ta koncepcja leży obecnie u podstaw produkcyjnej obsługi INT8 i 8PR. Można się spodziewać, że wygładzanie będzie połączone z bardziej szczegółowymi schematami, takimi jak kwantyzacja na grupę, wyuczone skalowanie i 4-bitowe badania aktywacji (np. metody uwzględniające wartości odstające). W miarę dojrzewania sprzętu FP8 (Hopper, Blackwell), równoważenie w stylu wygładzania będzie nadal wprowadzane do potoków kompilatora i silnika wnioskowania, więc kwantyzacja pozostanie prawie bezpłatna.
Implementacja w świecie rzeczywistym
Obsługa LLM z parametrami 70B w W8A8 na mniejszej liczbie procesorów graficznych poprzez zmniejszenie o połowę kosztów pamięci i mnożenia macierzy
Włączanie wnioskowania INT8 na rdzeniach tensorowych NVIDIA Hopper/Blackwell, które natywnie przyspieszają 8-bitową matematykę na liczbach całkowitych
Wdrażanie modeli czatów na punktach końcowych w chmurze o ograniczonych kosztach, gdzie podwojenie przepustowości bezpośrednio obniża rachunek za token
Kompresowanie koderów transformatorowych na potrzeby mowy lub tłumaczenia na urządzeniu, gdzie 8-bitowe jądra działają szybciej i chłodniej
Zagrożenia i poręcze
Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.
Koszty infrastruktury i utrzymania są często niedoszacowane.
W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.
Plan wdrożenia
Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.
Test porównawczy w realistycznych warunkach obciążenia i danych.
Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.
Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SmoothQuant and Activation Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Inżynieria sterowania i reprezentacji aktywacji
Często zadawane pytania
What is SmoothQuant and Activation Quantization?
SmoothQuant to technika umożliwiająca kompresję dużych modeli językowych do 8-bitowych liczb całkowitych zarówno dla wag, jak i aktywacji, bez konieczności ponownego uczenia. Ma to znaczenie, ponieważ aktywacje w dużych modelach zawierają skrajne wartości odstające, które zwykle niszczą matematykę o niskiej precyzji, a SmoothQuant je oswaja.
Jaki problem rozwiązuje SmoothQuant w zakresie wnioskowania o niskiej precyzji?
SmoothQuant celuje w duże wartości odstające, które pojawiają się w niektórych kanałach aktywacji, co w przeciwnym razie niszczy dokładność, gdy aktywacje są kwantowane do 8 bitów.
W jaki sposób SmoothQuant ułatwia kwantyfikację aktywacji?
Dzieli kanały aktywacji według skali dla każdego kanału i mnoży pasujące wagi przez tę skalę, więc iloczyn pozostaje niezmieniony, ale oba tensory stają się łatwiejsze do skwantowania.
Co oznacza oznaczenie W8A8?
W8A8 oznacza 8-bitową kwantyzację zarówno dla wag (W), jak i aktywacji (A), reżim, który SmoothQuant umożliwia przy minimalnej utracie dokładności.
Dlaczego skalowanie SmoothQuant zasadniczo nie powoduje narzutu na czas wykonania?
Skale wygładzające są dołączane do wag poprzedniej warstwy lub operacji łączonej z wyprzedzeniem, więc podczas wnioskowania nie są wykonywane żadne dodatkowe obliczenia.
Jaką rolę odgrywa hiperparametr alfa w SmoothQuant?
Alfa (zwykle 0,5) równoważy współczynnik wygładzania, decydując, jaka część trudności kwantyzacji zostanie przeniesiona z aktywacji na wagi.