SmoothQuant et quantification d’activation
SmoothQuant est une technique qui permet de compresser de grands modèles de langage jusqu'à des entiers de 8 bits pour les poids et les activations sans recyclage.
Aperçu
It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.
Plongée profonde
Lorsque vous réduisez un modèle de nombres flottants de 16 bits à des nombres entiers de 8 bits, les poids se compressent facilement mais les activations posent problème : certains canaux transportent des valeurs 10 à 100 fois plus grandes que les autres, et les forcer dans une grille entière grossière détruit la précision. SmoothQuant, introduit par Xiao et al. en 2022, observe que les poids sont fluides et faciles à quantifier tandis que les activations sont pointues. Il migre donc mathématiquement la difficulté : il divise les canaux d'activation par une échelle par canal et multiplie les poids correspondants par la même échelle. Les deux opérations s'annulent, laissant la sortie du modèle inchangée, mais les deux tenseurs se situent désormais dans des plages amies. Le résultat est une inférence W8A8 (pondérations et activations 8 bits) avec une perte de précision proche de zéro et une accélération et des économies de mémoire d'environ 2x.
Aperçu technique
L'astuce principale est un facteur de lissage par canal s calculé comme s = max(|X|)^alpha / max(|W|)^(1-alpha). Les activations sont mises à l'échelle par 1/s et les pondérations par s, de sorte que le produit matriciel XW est préservé. Étant donné que la mise à l’échelle est absorbée hors ligne dans les poids de la couche précédente ou dans une opération fusionnée, elle n’ajoute aucun coût d’exécution. L'hyperparamètre alpha (souvent 0,5) contrôle dans quelle mesure la charge des valeurs aberrantes se déplace des activations vers les poids.
Impact stratégique
Coût et budget
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
Décisions plus claires
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
Contrôle qualité
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
L'avenir de SmoothQuant et de la quantification d'activation
SmoothQuant a établi que les valeurs aberrantes d'activation sont migrables plutôt qu'inévitables, et cette idée sous-tend désormais la production des services INT8 et FP8. Attendez-vous à ce que le lissage soit combiné avec des schémas plus fins tels que la quantification par groupe, la mise à l'échelle apprise et la recherche d'activation sur 4 bits (par exemple, des méthodes prenant en compte les valeurs aberrantes). À mesure que le matériel FP8 (Hopper, Blackwell) mûrit, l'équilibrage de style lissage continuera à être intégré aux pipelines du compilateur et du moteur d'inférence, de sorte que la quantification reste presque gratuite.
Mise en œuvre dans le monde réel
Servir un LLM de 70 B de paramètres sur W8A8 sur moins de GPU en réduisant de moitié le coût de la mémoire et de la multiplication matricielle
Activation de l'inférence INT8 sur les cœurs tenseurs NVIDIA Hopper/Blackwell qui accélèrent nativement les calculs d'entiers 8 bits
Déployer des modèles de chat sur des points de terminaison cloud à coûts limités où le doublement du débit réduit directement la facture par jeton
Compression des encodeurs de transformateur pour la parole ou la traduction sur l'appareil où les noyaux 8 bits fonctionnent plus rapidement et plus froidement
Risques et garde-fous
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Feuille de route de mise en œuvre
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SmoothQuant and Activation Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Pilotage d’activation et ingénierie de représentation
Questions fréquemment posées
What is SmoothQuant and Activation Quantization?
SmoothQuant est une technique qui permet de compresser de grands modèles de langage jusqu'à des entiers de 8 bits pour les poids et les activations sans recyclage. C'est important car les activations dans les grands modèles contiennent des valeurs aberrantes extrêmes qui détruisent normalement les mathématiques de faible précision, et SmoothQuant les apprivoise.
Quel problème SmoothQuant résout-il spécifiquement dans l’inférence de faible précision ?
SmoothQuant cible les grandes valeurs aberrantes qui apparaissent dans certains canaux d'activation, qui détruisent autrement la précision lorsque les activations sont quantifiées sur 8 bits.
Comment SmoothQuant facilite-t-il la quantification des activations ?
Il divise les canaux d'activation par une échelle par canal et multiplie les poids correspondants par cette échelle, de sorte que le produit reste inchangé mais que les deux tenseurs deviennent plus faciles à quantifier.
Que signifie la notation W8A8 ?
W8A8 désigne une quantification sur 8 bits pour les poids (W) et les activations (A), le régime SmoothQuant permet avec une perte de précision minimale.
Pourquoi la mise à l'échelle de SmoothQuant n'ajoute-t-elle pratiquement aucune surcharge d'exécution ?
Les échelles de lissage sont intégrées à l'avance aux poids de la couche précédente ou à une opération fusionnée, de sorte qu'aucun calcul supplémentaire n'est effectué lors de l'inférence.
Quel rôle joue l’hyperparamètre alpha dans SmoothQuant ?
Alpha (généralement 0,5) équilibre le facteur de lissage, décidant dans quelle mesure la difficulté de quantification est déplacée des activations vers les poids.