SmoothQuant și cuantizare de activare
SmoothQuant este o tehnică care face posibilă comprimarea modelelor mari de limbaj până la numere întregi de 8 biți atât pentru greutăți, cât și pentru activări, fără reantrenare.
Prezentare generală
Contează pentru că activările în modelele mari conțin valori aberante extreme care distrug în mod normal matematica cu precizie scăzută, iar SmoothQuant le îmblânzește.
Scufundare în profunzime
Când micșorați un model de la 16 biți la numere întregi de 8 biți, greutățile se comprimă ușor, dar activările sunt probleme: anumite canale poartă valori de 10 până la 100 de ori mai mari decât restul, iar forțarea lor într-o grilă întregă grosieră distruge precizia. SmoothQuant, introdus de Xiao et al. în 2022, observă că greutățile sunt netede și ușor de cuantificat, în timp ce activările sunt înțepenite. Deci, migrează matematic dificultatea: împarte canalele de activare la o scară pe canal și înmulțește ponderile corespunzătoare cu aceeași scară. Cele două operațiuni se anulează, lăsând ieșirea modelului neschimbată, dar acum ambii tensori se află în intervale prietenoase. Rezultatul este inferența W8A8 (greutăți și activări de 8 biți) cu pierderi de precizie aproape de zero și accelerare de aproximativ 2x și economii de memorie.
Perspectivă tehnică
Trucul de bază este un factor de netezire pe canal s calculat ca s = max(|X|)^alfa / max(|W|)^(1-alfa). Activările sunt scalate cu 1/s și ponderile cu s, astfel încât produsul matriceal XW este păstrat. Deoarece scalarea este absorbită offline în greutățile stratului anterior sau într-o operație fuzionată, adaugă costuri de rulare zero. Hiperparametrul alfa (adesea 0,5) controlează cât de multă sarcină anormală trece de la activări la ponderi.
Impact strategic
Cost și buget
Deciziile de arhitectură generează performanța și costurile de operare de ani de zile.
Decizii mai clare
Educația tehnică ajută echipele să aleagă stiva potrivită, nu doar cea mai nouă.
Controlul calității
Opțiuni de inginerie mai bune reduc incidentele de fiabilitate în producție.
Viitorul SmoothQuant și cuantizarea activării
SmoothQuant a stabilit că valorile aberante de activare sunt mai degrabă migrabile decât inevitabile, iar această idee stă la baza producției INT8 și FP8. Așteptați-vă ca netezirea să fie combinată cu scheme cu granulație mai fină, cum ar fi cuantizarea pe grup, scalarea învățată și cercetarea activării pe 4 biți (de exemplu, metode conștiente de valori aberante). Pe măsură ce hardware-ul FP8 (Hopper, Blackwell) se maturizează, echilibrarea în stilul de netezire va continua să fie introdusă în conductele compilatorului și a motorului de inferență, astfel încât cuantificarea să rămână aproape liberă.
Implementare în lumea reală
Servirea unui LLM cu parametrii 70B la W8A8 pe mai puține GPU-uri prin înjumătățirea costurilor de memorie și de multiplicare a matricei
Activarea inferenței INT8 pe nucleele tensoare NVIDIA Hopper/Blackwell care accelerează în mod nativ matematica întregi pe 8 biți
Implementarea modelelor de chat pe terminale cloud cu costuri limitate, unde dublarea debitului reduce direct factura pe token
Comprimarea codificatoarelor cu transformator pentru vorbirea sau traducerea pe dispozitiv, unde nucleele pe 8 biți rulează mai repede și mai rece
Riscuri și balustrade
Optimizarea unui punct de referință poate ascunde slăbiciunile mai largi ale sistemului.
Costurile de infrastructură și întreținere sunt adesea subestimate.
Lacunele de securitate și observabilitate pot crește pe măsură ce sistemele devin mai complexe.
Foaia de parcurs de implementare
Definiți obiectivele de latență, calitate și cost înainte de implementare.
Benchmark în condiții realiste de încărcare și date.
Monitorizarea instrumentelor pentru erori, deriva și impactul utilizatorului.
Pregătiți căile de retragere și răspuns la incident înainte de scalare.
Continuați să explorați
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SmoothQuant and Activation Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Următorul ghid
Inginerie de conducere și reprezentare a activării
Întrebări frecvente
Ce este SmoothQuant și Activation Quantization?
SmoothQuant este o tehnică care face posibilă comprimarea modelelor mari de limbaj până la numere întregi de 8 biți atât pentru greutăți, cât și pentru activări, fără reantrenare. Contează pentru că activările în modelele mari conțin valori aberante extreme care distrug în mod normal matematica cu precizie scăzută, iar SmoothQuant le îmblânzește.
Ce problemă abordează în mod specific SmoothQuant în inferența cu precizie scăzută?
SmoothQuant vizează valorile aberante mari care apar în anumite canale de activare, care altfel distrug acuratețea atunci când activările sunt cuantificate la 8 biți.
Cum face SmoothQuant activările mai ușor de cuantificat?
Împarte canalele de activare la o scară pe canal și înmulțește greutățile potrivite cu acea scară, astfel încât produsul rămâne neschimbat, dar ambii tensori devin mai ușor de cuantificat.
Ce înseamnă notația W8A8?
W8A8 denotă cuantificarea pe 8 biți atât pentru greutăți (W) cât și pentru activări (A), regimul SmoothQuant îl permite cu o pierdere minimă de precizie.
De ce scalarea lui SmoothQuant nu adaugă practic nicio suprasarcină de rulare?
Scalele de netezire sunt pliate în greutățile stratului precedent sau într-o operațiune fuzionată înainte de timp, astfel încât nu se întâmplă niciun calcul suplimentar la inferență.
Ce rol joacă hiperparametrul alfa în SmoothQuant?
Alpha (de obicei 0,5) echilibrează factorul de netezire, hotărând cât de mult din dificultatea de cuantizare este mutată de la activări și pe ponderi.