FP8 et formats de basse précision
FP8 est un format de nombres à virgule flottante de 8 bits qui permet aux modèles d'IA de stocker des poids et d'exécuter des calculs en utilisant un quart de la mémoire des nombres standard de 32 bits.
Aperçu
C’est un truc clé pour rendre les modèles géants moins chers et plus rapides à entraîner et à servir.
Plongée profonde
Les réseaux de neurones sont constitués de milliards de nombres. Traditionnellement, ces nombres utilisaient 32 bits (FP32) ou 16 bits (FP16/BF16) chacun. FP8 les réduit à seulement 8 bits, réduisant ainsi la mémoire et la bande passante environ de moitié par rapport à 16 bits. Il existe deux configurations FP8 courantes : E4M3 (4 bits d'exposant, 3 bits de mantisse) donne plus de précision mais une plage plus petite, et E5M2 (5 exposants, 2 mantisses) donne une plage plus large mais des pas plus grossiers. Le compromis est la fidélité : moins de bits signifie des erreurs d’arrondi. Pour rester précis, les frameworks appliquent des facteurs de mise à l'échelle par tenseur ou par bloc qui redimensionnent les valeurs dans la plage utilisable du FP8. Les GPU Hopper et Blackwell de NVIDIA ont ajouté des moteurs matriciels matériels FP8, ce qui les rend pratiques à la fois pour la formation et l'inférence. Les formats plus récents comme MXFP8, MXFP4 et NVFP4 poussent encore plus bas avec des blocs de micro-mise à l'échelle partagés.
Aperçu technique
Le défi du FP8 est la plage dynamique. Avec seulement une poignée de bits d'exposant, les activations grandes ou petites débordent ou descendent jusqu'à zéro. La solution est la mise à l'échelle : multipliez un tenseur par un facteur pour que ses valeurs atterrissent dans la fenêtre représentable du FP8, multipliez-accumulez le FP8, puis divisez-le, accumulant souvent des sommes partielles avec une plus grande précision (FP16/FP32). E4M3 est généralement utilisé pour les poids et les activations, E5M2 pour les gradients où la portée compte plus que la précision.
Impact stratégique
Coût et budget
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
Décisions plus claires
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
Contrôle qualité
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
L'avenir du FP8 et des formats de basse précision
La précision diminue. Après FP8 sont arrivés les formats de micro-mise à l'échelle 4 bits (MXFP4, NVFP4) qui contiennent une petite échelle partagée par petit bloc, et le matériel Blackwell accélère désormais directement FP4. Attendez-vous à des recettes de précision mixte dans lesquelles différentes couches utilisent différentes largeurs de bits, ainsi qu'à une meilleure formation prenant en compte la quantification afin que 4 bits deviennent la valeur par défaut pour l'inférence. L’objectif final consiste à regrouper des modèles à l’échelle frontière sur des puces moins nombreuses et moins chères sans perte de qualité mesurable.
Mise en œuvre dans le monde réel
Formation de modèles de langage volumineux sur les GPU NVIDIA Hopper/Blackwell à l'aide de FP8 pour doubler environ le débit par rapport à BF16
Servir l'inférence de chatbot dans FP8 afin qu'un modèle s'adapte à moins de GPU et réponde à plus de requêtes par seconde
Utilisation d'E5M2 pour la communication par gradient pendant la formation distribuée afin de réduire la bande passante du réseau entre les nœuds
Déploiement de modèles quantifiés MXFP4/NVFP4 pour adapter un modèle à l'échelle frontière sur un seul GPU à haute mémoire pour une inférence moins coûteuse
Risques et garde-fous
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Feuille de route de mise en œuvre
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the FP8 and Low-Precision Formats quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Formats de sérialisation des modèles
Questions fréquemment posées
Qu’est-ce que les formats FP8 et Basse Précision ?
FP8 est un format de nombres à virgule flottante de 8 bits qui permet aux modèles d'IA de stocker des poids et d'exécuter des calculs en utilisant un quart de la mémoire des nombres standard de 32 bits. Il s’agit d’une astuce clé pour rendre les modèles géants moins chers et plus rapides à former et à servir.
Combien de bits un numéro FP8 utilise-t-il par rapport à un numéro FP32 standard ?
FP8 utilise 8 bits tandis que FP32 utilise 32 bits, donc FP8 prend un quart du stockage et de la bande passante.
Que décrivent les étiquettes « E4M3 » et « E5M2 » à propos d'un format FP8 ?
E4M3 signifie 4 bits d'exposant et 3 bits de mantisse ; E5M2 signifie 5 exposants et 2 bits de mantisse. Des bits d'exposant plus nombreux élargissent la plage ; plus de bits de mantisse ajoutent de la précision.
Pourquoi les pipelines FP8 appliquent-ils des facteurs d'échelle aux tenseurs ?
Avec si peu de bits d'exposant, les grandes valeurs débordent et les plus petites descendent jusqu'à zéro. La mise à l'échelle redimensionne les tenseurs dans la fenêtre utilisable du FP8 avant les calculs.
Quel est le principal inconvénient de l’utilisation du 8e PC ?
Moins de bits signifie une représentation plus grossière et plus d’erreurs d’arrondi. L'avantage est beaucoup moins de mémoire et de bande passante, ainsi que des calculs plus rapides sur le matériel pris en charge.
Quelle génération de GPU NVIDIA a ajouté pour la première fois la prise en charge matérielle dédiée aux mathématiques matricielles FP8 ?
Les GPU basés sur Hopper comme le H100 ont introduit la prise en charge du FP8 Tensor Core, et Blackwell l'a ensuite étendu au FP4.