GUIDE Technique

Mémoire à bande passante élevée

La mémoire à bande passante élevée (HBM) est une mémoire empilée placée juste à côté du GPU qui fournit des données beaucoup plus rapidement que la RAM ordinaire.

2 minutes de lectureDernière mise à jour

Aperçu

It is what keeps AI accelerators fed, preventing the powerful compute cores from sitting idle while they wait for model weights and data.

Plongée profonde

HBM résout un goulot d’étranglement fondamental : les puces d’IA modernes peuvent effectuer des milliards d’opérations par seconde, mais seulement si les données arrivent suffisamment rapidement. La mémoire GDDR standard se connecte via un bus relativement étroit, tandis que HBM empile plusieurs puces DRAM verticalement et les connecte avec des milliers de minuscules fils verticaux appelés vias traversants en silicium (TSV). Ces piles reposent sur un intercalaire en silicium à quelques millimètres du GPU, offrant un chemin de données extrêmement large, pensez à des milliers de bits à la fois au lieu de centaines. Le résultat est une bande passante mesurée en téraoctets par seconde. Les générations sont passées du HBM2 au HBM2e, HBM3 et HBM3e, chacune augmentant à la fois la capacité et la vitesse. Pour les modèles de langage volumineux, dont les pondérations doivent être diffusées en permanence, la capacité et la bande passante HBM comptent souvent plus que le calcul brut.

Aperçu technique

HBM atteint sa vitesse grâce à un parallélisme extrême plutôt qu'à des fréquences d'horloge plus élevées. En empilant des matrices DRAM et en les reliant à des milliers de TSV, il expose une interface très large (1 024 bits par pile et plus), de sorte que de nombreux octets se déplacent simultanément. Placer les piles sur un interposeur partagé à côté du GPU permet de garder les fils courts, réduisant ainsi la puissance par bit et la latence. Un seul accélérateur comme un NVIDIA H100 ou H200 associe plusieurs piles HBM pour atteindre plusieurs téraoctets par seconde de bande passante mémoire totale.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L'avenir de la mémoire à large bande passante

La bande passante mémoire constitue désormais une contrainte majeure pour l’IA, c’est pourquoi HBM progresse rapidement. HBM3e est livré dans des accélérateurs phares, et HBM4 à l'horizon promet des interfaces plus larges, des piles plus hautes et plus de capacité par package. Attendez-vous à une co-conception plus étroite entre la mémoire et la logique, éventuellement à des matrices de base personnalisées et à un traitement proche de la mémoire, ainsi qu'à une concurrence féroce entre des fournisseurs comme SK hynix, Samsung et Micron. À mesure que les modèles se développent, le fait de rapprocher davantage de données du calcul, plus rapidement et avec moins d’énergie, reste au cœur du progrès du matériel d’IA.

Mise en œuvre dans le monde réel

Conserver les dizaines ou centaines de gigaoctets de pondérations pour un grand modèle de langage à proximité du GPU afin qu'ils puissent être diffusés à chaque étape d'inférence.

Permet aux GPU des centres de données NVIDIA H100 et H200 d'atteindre plusieurs téraoctets par seconde de bande passante mémoire pour l'entraînement.

Alimenter des clusters de formation d'IA où de nombreux GPU s'appuient chacun sur HBM pour éviter de stagner entre les opérations matricielles.

Prise en charge de modèles d'images et de vidéos génératifs haute résolution qui doivent déplacer rapidement d'énormes tenseurs d'activation dans et hors de la mémoire.

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the High Bandwidth Memory quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Gestion et fragmentation de la mémoire GPU

Questions fréquemment posées

What is High Bandwidth Memory?

La mémoire à bande passante élevée (HBM) est une mémoire empilée placée juste à côté du GPU qui fournit des données beaucoup plus rapidement que la RAM ordinaire. C’est ce qui permet aux accélérateurs d’IA de rester alimentés, empêchant les puissants cœurs de calcul de rester inactifs pendant qu’ils attendent les pondérations et les données des modèles.

Quel problème principal la mémoire à large bande passante résout-elle pour les accélérateurs d’IA ?

Les puces d’IA peuvent effectuer des milliards d’opérations par seconde uniquement si les données arrivent suffisamment rapidement ; HBM fournit cette bande passante afin que les cœurs ne soient pas affamés.

En quoi la mémoire HBM est-elle physiquement construite différemment de la mémoire GDDR ordinaire ?

HBM empile les matrices DRAM les unes sur les autres et les relie avec des milliers de fils verticaux (TSV), créant ainsi un chemin de données très large.

Sur quoi HBM s’appuie-t-il principalement pour atteindre sa bande passante élevée ?

Plutôt que de synchroniser plus rapidement, HBM expose une interface très large (1 024 bits par pile et plus), de sorte que de nombreux octets se déplacent en même temps.

Pourquoi les piles HBM sont-elles placées sur un interposeur en silicium juste à côté du GPU ?

Les fils courts sur un interposeur partagé réduisent l'énergie nécessaire par bit transféré et réduisent la latence entre la mémoire et le calcul.

Pour les grands modèles de langage en particulier, pourquoi le HBM peut-il être aussi important que le calcul brut ?

L'inférence LLM diffuse en continu des matrices de poids importantes, de sorte que la capacité de mémoire et la bande passante deviennent souvent le facteur limitant plutôt que le débit de calcul.