GUIDE IA du langage

Quantification

La quantification réduit un modèle d'IA en stockant ses chiffres avec une précision moindre, de sorte qu'un modèle nécessitant un GPU de centre de données peut parfois fonctionner sur un ordinateur portable ou un téléphone.

2 minutes de lectureDernière mise à jour

Aperçu

It is the main trick that makes large language models cheap and fast enough to deploy widely.

Plongée profonde

Un réseau neuronal est principalement une pile géante de nombres appelés poids, normalement stockés sous forme de valeurs à virgule flottante de 16 ou 32 bits. La quantification restaure ces poids en utilisant moins de bits, généralement des entiers de 8 bits (INT8) ou même de 4 bits. Passer de 16 bits à 4 bits réduit la mémoire environ par quatre, de sorte qu'un modèle de 70 milliards de paramètres qui nécessite environ 140 Go à 16 bits peut contenir environ 35 Go à 4 bits. Les nombres plus petits se déplacent également plus rapidement dans la mémoire, ce qui accélère généralement la génération. Le problème, c'est la précision : le fait de regrouper une large plage de valeurs en quelques niveaux introduit une erreur d'arrondi. Les bonnes méthodes minimisent cette perte en choisissant soigneusement les facteurs d'échelle et en protégeant les poids les plus sensibles, de sorte que le modèle se comporte presque de manière identique tout en utilisant une fraction des ressources.

Aperçu technique

Chaque groupe de poids reçoit un facteur d'échelle qui mappe les valeurs réelles sur un petit ensemble d'entiers ; la multiplication par l'échelle reconstruit approximativement le nombre d'origine. Les méthodes de quantification post-formation telles que GPTQ et AWQ analysent un petit ensemble de données d'étalonnage pour décider quels poids sont les plus importants et définissent des échelles pour minimiser les erreurs de sortie, plutôt que de tout arrondir aveuglément. Les activations sont souvent conservées avec une plus grande précision car elles varient davantage au moment de l'exécution. Le résultat est un modèle qui stocke des entiers de 4 bits mais calcule des résultats extrêmement proches de la version pleine précision.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L'avenir de la quantification

Attendez-vous à ce que la quantification devienne la valeur par défaut plutôt qu'une optimisation. Les fournisseurs de matériel ajoutent dès le départ au modèle une prise en charge native de 4 bits et même de bits inférieurs, ainsi que des techniques telles que la tolérance d'apprentissage basée sur la quantification pour une faible précision, réduisant ainsi davantage la perte de précision. La recherche sur les représentations 2 bits et 1 bit (binaire) est active, dans le but d'exécuter des modèles performants sur les téléphones et les puces embarquées. À mesure que l’IA sur appareil et privée se développe, des modèles quantifiés efficaces seront essentiels pour exécuter des assistants localement sans envoyer de données vers le cloud.

Mise en œuvre dans le monde réel

Exécution d'un modèle de chat comme Llama localement sur un GPU grand public à l'aide de fichiers GGUF ou GPTQ 4 bits au lieu d'avoir besoin de plusieurs cartes de centre de données.

Assistants intégrés sur les téléphones, où les modèles 8 bits ou 4 bits permettent aux fonctionnalités vocales et textuelles de s'exécuter sans connexion réseau.

Réduisez les coûts d'inférence cloud pour un bot de support client en proposant un modèle INT8, en adressant davantage de requêtes sur chaque GPU.

Des appareils de pointe tels que des caméras intelligentes ou des capteurs IoT exécutant des modèles compacts de langage de vision quantifié dans des limites de mémoire strictes.

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Quantification vectorielle résiduelle

Questions fréquemment posées

What is Quantization?

La quantification réduit un modèle d'IA en stockant ses chiffres avec une précision moindre, de sorte qu'un modèle nécessitant un GPU de centre de données peut parfois fonctionner sur un ordinateur portable ou un téléphone. C’est l’astuce principale qui rend les grands modèles de langage bon marché et suffisamment rapides pour être déployés à grande échelle.

Qu'est-ce que la quantification change principalement dans un réseau de neurones ?

La quantification restaure les poids du modèle avec une précision numérique inférieure, comme des entiers de 8 ou 4 bits au lieu de flottants de 16 ou 32 bits.

Quelle quantité de mémoire environ est économisée en déplaçant les pondérations de 16 bits à 4 bits ?

4 bits correspondent à un quart de 16 bits, donc le poids de stockage tombe à environ un quart, soit une réduction d'environ 4 fois.

Quel est le principal inconvénient d’une quantification agressive ?

Représenter les valeurs avec moins de niveaux introduit une erreur d’arrondi, qui peut dégrader la qualité du résultat si elle n’est pas gérée avec soin.

Pourquoi des méthodes telles que GPTQ et AWQ utilisent-elles un petit ensemble de données d'étalonnage ?

Ces méthodes de post-formation analysent quelques exemples d'entrées pour définir des facteurs de mise à l'échelle et protéger les pondérations sensibles, en gardant les sorties proches de l'original.

Pourquoi la quantification rend-elle souvent un modèle plus rapide, et pas seulement plus petit ?

Les valeurs de précision inférieure nécessitent moins de bande passante mémoire pour être chargées et déplacées, ce qui constitue souvent un goulot d'étranglement lors de la génération, ce qui accélère l'inférence.