GUIDE Technique

Quantification post-formation GPTQ et AWQ

GPTQ et AWQ sont deux méthodes principales permettant de réduire les modèles de langage déjà formés à une précision de 4 bits afin qu'ils fonctionnent sur du matériel moins cher et plus petit.

2 minutes de lectureDernière mise à jour

Aperçu

They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.

Plongée profonde

La quantification post-entraînement (PTQ) compresse un modèle fini sans le recycler, en mappant des poids de haute précision jusqu'à 4 bits pour environ un quart de la mémoire. Le défi est de le faire sans détruire la précision. GPTQ (un raffinement d'OBQ) quantifie les poids couche par couche, en utilisant des informations de second ordre provenant d'un petit ensemble de données d'étalonnage pour ajuster les poids restants et compenser chaque erreur d'arrondi. L'AWQ (Activation-aware Weight Quantization) adopte un angle différent : il observe qu'une petite fraction des canaux de poids est d'une importance disproportionnée, identifiée en examinant les magnitudes d'activation, et protège ces canaux saillants en les mettant à l'échelle plutôt qu'en les quantifiant de manière agressive. Les deux permettent à des modèles comme Llama de fonctionner en 4 bits, et des outils tels que vLLM, llama.cpp et AutoGPTQ les ont généralisés pour une inférence locale et rentable.

Aperçu technique

GPTQ utilise une approximation du Hessian (courbure de la perte) pour décider comment l'arrondi d'un poids doit pousser les autres, minimisant ainsi l'erreur introduite. AWQ ignore entièrement les Hessiens : il calcule un facteur d'échelle par canal afin que les canaux de poids importants conservent leur précision effective, puis quantifie uniformément. Les deux maintiennent les activations avec une plus grande précision et ne compressent que les poids, car les poids dominent la mémoire tandis que la quantification de l'activation a tendance à nuire davantage à la précision.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L'avenir de la quantification post-formation GPTQ et AWQ

La quantification pousse en dessous de 4 bits vers des schémas de précision 3 bits, 2 bits et mixtes, souvent combinés à une parcimonie. Attendez-vous à un couplage plus étroit avec les moteurs de service afin que la quantification, la compression du cache KV et le décodage spéculatif fonctionnent ensemble. La prise en charge matérielle des formats à faible débit tels que NVFP4 et MXFP4 évolue et les outils automatisés choisiront de plus en plus de largeurs de bits par couche. L'objectif général est d'utiliser par défaut un format 4 bits (et moins) quasiment sans perte, ce qui rend les modèles puissants et peu coûteux à utiliser partout.

Mise en œuvre dans le monde réel

Exécution d'un modèle Llama de 70 milliards de paramètres sur un seul GPU grand public de 24 Go à l'aide de pondérations GPTQ 4 bits.

Modèles quantifiés AWQ servis à haut débit dans vLLM pour des API de production rentables.

llama.cpp utilisant des poids GGUF quantifiés pour exécuter des modèles de langage localement sur un processeur d'ordinateur portable.

Les bibliothèques AutoGPTQ et AutoAWQ de Hugging Face permettent aux développeurs de quantifier un modèle téléchargé en quelques lignes de code.

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPTQ and AWQ Post-Training Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Fonctions d'influence pour l'attribution des données de formation

Questions fréquemment posées

What is GPTQ and AWQ Post-Training Quantization?

GPTQ et AWQ sont deux méthodes principales permettant de réduire les modèles de langage déjà formés à une précision de 4 bits afin qu'ils fonctionnent sur du matériel moins cher et plus petit. C'est pourquoi vous pouvez exécuter un modèle performant sur un seul GPU grand public au lieu d'un rack de centre de données.

Que signifie « quantification post-formation » ?

La quantification post-entraînement réduit la précision des poids d'un modèle fini (par exemple, à 4 bits) sans le recycler à partir de zéro.

Quelles informations GPTQ utilise-t-il pour compenser les erreurs d'arrondi lors de la quantification ?

GPTQ utilise un Hessian approximatif pour comprendre comment la quantification d'un poids affecte la perte, puis ajuste les poids restants pour compenser.

Quelle information clé anime l’AWQ (Activation-aware Weight Quantization) ?

AWQ identifie les canaux de poids saillants à l'aide des magnitudes d'activation et les protège via une mise à l'échelle, car quelques canaux comptent de manière disproportionnée.

Environ combien de mémoire la quantification 4 bits économise-t-elle par rapport aux pondérations 16 bits ?

Passer de 16 bits à 4 bits par poids réduit la mémoire de poids d'environ un quart, soit une réduction d'environ 4 fois.

Pourquoi GPTQ et AWQ quantifient-ils généralement les poids mais maintiennent-ils les activations avec une plus grande précision ?

Les poids constituent le principal coût en mémoire, tandis que les activations sont plus sensibles à la perte de précision, de sorte que la quantification basée uniquement sur le poids est le point idéal commun.