Noyaux tenseurs
Les cœurs Tensor sont des unités matérielles spécialisées intégrées aux GPU NVIDIA modernes qui effectuent des opérations de multiplication et d'accumulation matricielles extrêmement rapides.
Aperçu
They are the main reason a single GPU can train and run large neural networks orders of magnitude faster than general-purpose compute would allow.
Plongée profonde
Introduits avec l'architecture Volta en 2017, les Tensor Cores sont des circuits dédiés qui calculent une petite multiplication matricielle plus une addition (D = A x B + C) en une seule opération, plutôt que d'effectuer chaque multiplication une à la fois sur des cœurs CUDA standard. Étant donné que pratiquement chaque couche d’un réseau neuronal se réduit à des multiplications matricielles, cela correspond aux besoins mathématiques réels de l’IA. Chaque génération de GPU a élargi ce qu'elle gère : Volta a créé des tuiles 4x4 FP16, tandis que les architectures ultérieures Ampere, Hopper et Blackwell ont ajouté des formats de précision inférieure comme TF32, BF16, INT8, FP8 et FP4. Une précision inférieure signifie plus de nombres traités par horloge, ce qui augmente considérablement le débit de formation et d'inférence tout en gardant une précision acceptable.
Aperçu technique
Un Tensor Core multiplie deux petites matrices et accumule le résultat en une seule étape fusionnée, exploitant le fait que les mêmes valeurs d'entrée sont réutilisées dans de nombreux éléments de sortie. Il lit généralement les entrées avec une précision réduite (FP16, BF16 ou FP8) mais accumule la somme cumulée avec une précision plus élevée (souvent FP32) pour limiter les erreurs d'arrondi. Les bibliothèques de logiciels comme cuBLAS et cuDNN, et les frameworks comme PyTorch, regroupent automatiquement de grandes matrices dans ces petits blocs afin que les modèles obtiennent une accélération sans codage manuel.
Impact stratégique
Coût et budget
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
Décisions plus claires
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
Contrôle qualité
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
L'avenir des cœurs tenseurs
Les cœurs Tensor continuent d'évoluer vers une précision de plus en plus faible : Hopper a ajouté le FP8 et Blackwell a introduit le FP4 4 bits avec une mise à l'échelle gérée par le matériel, doublant environ le débit à chaque étape pour les charges de travail lourdes d'inférence. Attendez-vous à une prise en charge plus stricte de la parcimonie (en sautant les poids nuls), à des formats de micro-échelle qui attachent des facteurs d'échelle à de petits blocs de nombres et à une intégration plus profonde avec les systèmes de mémoire afin que les cœurs restent alimentés. À mesure que les modèles se développent, c’est le moteur matriciel, et non la vitesse d’horloge brute, qui reste le champ de bataille central pour les performances matérielles de l’IA.
Mise en œuvre dans le monde réel
Formation de grands modèles de langage tels que des transformateurs de style GPT, où des milliards de multiplications matricielles par étape s'exécutent sur des cœurs Tensor dans BF16 ou FP8.
Exécution d'inférences en temps réel pour les chatbots et les générateurs d'images, en utilisant la quantification INT8 ou FP8 pour servir davantage d'utilisateurs par GPU.
Accélération de NVIDIA DLSS dans les jeux vidéo, où un réseau neuronal met à l'échelle les images de résolution inférieure à l'aide de Tensor Cores pour chaque image.
Accélérer le calcul scientifique tel que le repliement des protéines (AlphaFold) et les modèles météorologiques qui ont été reformulés en charges de travail neuronales lourdes en matrice.
Risques et garde-fous
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Feuille de route de mise en œuvre
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tensor Cores quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Parallélisme tensoriel pour les grands modèles
Questions fréquemment posées
What is Tensor Cores?
Les cœurs Tensor sont des unités matérielles spécialisées intégrées aux GPU NVIDIA modernes qui effectuent des opérations de multiplication et d'accumulation matricielles extrêmement rapides. C’est la principale raison pour laquelle un seul GPU peut former et exécuter de grands réseaux neuronaux des ordres de grandeur plus rapidement que ne le permettrait le calcul à usage général.
Quelle opération mathématique de base les Tensor Cores sont-ils spécifiquement conçus pour accélérer ?
Les cœurs tenseurs effectuent une multiplication matricielle fusionnée et une accumulation en une seule étape, ce qui est exactement l'opération qui domine les couches de réseau neuronal.
Quelle architecture GPU NVIDIA a introduit pour la première fois les Tensor Cores ?
Tensor Cores a fait ses débuts avec l'architecture Volta en 2017, en commençant par les opérations matricielles FP16 4x4.
Pourquoi les Tensor Cores utilisent-ils souvent une précision réduite comme FP16 ou FP8 ?
Utiliser moins de bits par nombre signifie que davantage de valeurs circulent dans le matériel à chaque cycle, ce qui augmente considérablement la vitesse avec seulement une petite perte de précision, généralement tolérable.
Pour préserver la précision, quelle précision les Tensor Cores utilisent-ils généralement pour la somme cumulée (accumulation) ?
Les entrées peuvent être de faible précision, mais l'accumulateur fonctionne généralement avec une précision plus élevée, comme le FP32, pour limiter l'accumulation d'erreurs d'arrondi.
Comment les frameworks d'IA quotidiens comme PyTorch utilisent-ils les Tensor Cores ?
Les bibliothèques sous-jacentes divisent automatiquement les grandes opérations matricielles en tuiles de la taille d'un Tensor-Core, de sorte que les frameworks obtiennent une accélération sans codage manuel.