GUIDE Technique

SmoothQuant et quantification d’activation

SmoothQuant est une technique qui permet de compresser de grands modèles de langage jusqu'à des entiers de 8 bits pour les poids et les activations sans recyclage.

2 minutes de lectureDernière mise à jour

Aperçu

It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.

Plongée profonde

Lorsque vous réduisez un modèle de nombres flottants de 16 bits à des nombres entiers de 8 bits, les poids se compressent facilement mais les activations posent problème : certains canaux transportent des valeurs 10 à 100 fois plus grandes que les autres, et les forcer dans une grille entière grossière détruit la précision. SmoothQuant, introduit par Xiao et al. en 2022, observe que les poids sont fluides et faciles à quantifier tandis que les activations sont pointues. Il migre donc mathématiquement la difficulté : il divise les canaux d'activation par une échelle par canal et multiplie les poids correspondants par la même échelle. Les deux opérations s'annulent, laissant la sortie du modèle inchangée, mais les deux tenseurs se situent désormais dans des plages amies. Le résultat est une inférence W8A8 (pondérations et activations 8 bits) avec une perte de précision proche de zéro et une accélération et des économies de mémoire d'environ 2x.

Aperçu technique

L'astuce principale est un facteur de lissage par canal s calculé comme s = max(|X|)^alpha / max(|W|)^(1-alpha). Les activations sont mises à l'échelle par 1/s et les pondérations par s, de sorte que le produit matriciel XW est préservé. Étant donné que la mise à l’échelle est absorbée hors ligne dans les poids de la couche précédente ou dans une opération fusionnée, elle n’ajoute aucun coût d’exécution. L'hyperparamètre alpha (souvent 0,5) contrôle dans quelle mesure la charge des valeurs aberrantes se déplace des activations vers les poids.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L'avenir de SmoothQuant et de la quantification d'activation

SmoothQuant a établi que les valeurs aberrantes d'activation sont migrables plutôt qu'inévitables, et cette idée sous-tend désormais la production des services INT8 et FP8. Attendez-vous à ce que le lissage soit combiné avec des schémas plus fins tels que la quantification par groupe, la mise à l'échelle apprise et la recherche d'activation sur 4 bits (par exemple, des méthodes prenant en compte les valeurs aberrantes). À mesure que le matériel FP8 (Hopper, Blackwell) mûrit, l'équilibrage de style lissage continuera à être intégré aux pipelines du compilateur et du moteur d'inférence, de sorte que la quantification reste presque gratuite.

Mise en œuvre dans le monde réel

Servir un LLM de 70 B de paramètres sur W8A8 sur moins de GPU en réduisant de moitié le coût de la mémoire et de la multiplication matricielle

Activation de l'inférence INT8 sur les cœurs tenseurs NVIDIA Hopper/Blackwell qui accélèrent nativement les calculs d'entiers 8 bits

Déployer des modèles de chat sur des points de terminaison cloud à coûts limités où le doublement du débit réduit directement la facture par jeton

Compression des encodeurs de transformateur pour la parole ou la traduction sur l'appareil où les noyaux 8 bits fonctionnent plus rapidement et plus froidement

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SmoothQuant and Activation Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Pilotage d’activation et ingénierie de représentation

Questions fréquemment posées

What is SmoothQuant and Activation Quantization?

SmoothQuant est une technique qui permet de compresser de grands modèles de langage jusqu'à des entiers de 8 bits pour les poids et les activations sans recyclage. C'est important car les activations dans les grands modèles contiennent des valeurs aberrantes extrêmes qui détruisent normalement les mathématiques de faible précision, et SmoothQuant les apprivoise.

Quel problème SmoothQuant résout-il spécifiquement dans l’inférence de faible précision ?

SmoothQuant cible les grandes valeurs aberrantes qui apparaissent dans certains canaux d'activation, qui détruisent autrement la précision lorsque les activations sont quantifiées sur 8 bits.

Comment SmoothQuant facilite-t-il la quantification des activations ?

Il divise les canaux d'activation par une échelle par canal et multiplie les poids correspondants par cette échelle, de sorte que le produit reste inchangé mais que les deux tenseurs deviennent plus faciles à quantifier.

Que signifie la notation W8A8 ?

W8A8 désigne une quantification sur 8 bits pour les poids (W) et les activations (A), le régime SmoothQuant permet avec une perte de précision minimale.

Pourquoi la mise à l'échelle de SmoothQuant n'ajoute-t-elle pratiquement aucune surcharge d'exécution ?

Les échelles de lissage sont intégrées à l'avance aux poids de la couche précédente ou à une opération fusionnée, de sorte qu'aucun calcul supplémentaire n'est effectué lors de l'inférence.

Quel rôle joue l’hyperparamètre alpha dans SmoothQuant ?

Alpha (généralement 0,5) équilibre le facteur de lissage, décidant dans quelle mesure la difficulté de quantification est déplacée des activations vers les poids.