Réseau InfiniBand et RDMA
InfiniBand est une interconnexion à haut débit et à faible latence qui relie les serveurs et les GPU dans des clusters d'IA, et RDMA permet à une machine de lire ou d'écrire la mémoire d'une autre sans impliquer le processeur.
Aperçu
Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.
Plongée profonde
Lorsque vous entraînez un modèle sur des milliers de GPU, c'est souvent le réseau qui devient le goulot d'étranglement, et non les puces. InfiniBand est une structure commutée spécialement conçue à cet effet : elle offre une bande passante par liaison de l'ordre de centaines de gigabits par seconde (NDR fonctionne à 400 Gb/s) et une latence à l'échelle de la microseconde. Son astuce clé est l'accès direct à la mémoire à distance (RDMA), qui déplace les données directement entre la mémoire de deux nœuds, en contournant le noyau du système d'exploitation et les copies du processeur qui ralentissent le TCP/IP ordinaire. Ce « contournement du noyau » libère les cycles du processeur et réduit la latence. InfiniBand fournit également un contrôle de flux matériel pour une structure sans perte, et les commutateurs Quantum de NVIDIA ainsi que les adaptateurs ConnectX dominent les supercalculateurs IA. RoCE (RDMA over Converged Ethernet) apporte des avantages RDMA similaires aux réseaux Ethernet.
Aperçu technique
RDMA fonctionne via des verbes et des paires de files d'attente. Une application publie des demandes de travail pour envoyer et recevoir des files d'attente ; l'adaptateur réseau (le HCA) les lit et transfère les données directement dans des régions de mémoire préenregistrées et épinglées sur l'hôte distant. Étant donné que la carte réseau gère le transfert matériel et que le noyau du système d'exploitation est contourné, il n'y a aucune copie de données et aucune interruption du processeur par paquet pour le transfert en masse. Le contrôle de flux basé sur le crédit au niveau de la couche liaison d'InfiniBand empêche le débordement de la mémoire tampon, rendant la structure sans perte et sans tempêtes de retransmission.
Impact stratégique
Coût et budget
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
Décisions plus claires
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
Contrôle qualité
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
L'avenir des réseaux InfiniBand et RDMA
La bande passante ne cesse de grimper : XDR InfiniBand vise 800 Gb/s par liaison, avec des feuilles de route vers 1,6 Tb/s. La concurrence s'intensifie à mesure que l'Ultra Ethernet Consortium conçoit un Ethernet qui correspond à InfiniBand pour les charges de travail d'IA, et que l'informatique en réseau (SHARP) transfère les mathématiques collectives vers les commutateurs eux-mêmes. Attendez-vous à une intégration GPU-réseau plus étroite, à des interconnexions optiques pour couper l’alimentation et à des structures adaptées à des clusters de centaines de milliers d’accélérateurs à mesure que les modèles de pointe se développent.
Mise en œuvre dans le monde réel
Connecter des milliers de GPU dans un supercalculateur IA afin que les données de gradient se déplacent entre les nœuds en microsecondes pendant l'entraînement distribué
Permettre à un serveur de lire directement la mémoire d'un autre (RDMA) pour accélérer les systèmes de fichiers distribués et les bases de données sans surcharge du processeur
Exécution d'opérations de réduction totale NCCL sur InfiniBand pour synchroniser les poids de modèle sur un cluster GPU
Utilisation de RoCE pour apporter des transferts à faible latence de type RDMA aux réseaux de centres de données Ethernet existants
Risques et garde-fous
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Feuille de route de mise en œuvre
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the InfiniBand and RDMA Networking quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Pipelines d’ingénierie de fonctionnalités et gestion des versions de données
Questions fréquemment posées
What is InfiniBand and RDMA Networking?
InfiniBand est une interconnexion à haut débit et à faible latence qui relie les serveurs et les GPU dans des clusters d'IA, et RDMA permet à une machine de lire ou d'écrire la mémoire d'une autre sans impliquer le processeur. Ensemble, ils constituent la plomberie qui permet à des milliers de GPU d'être alimentés en données pendant la formation de grands modèles.
Qu'est-ce que RDMA permet fondamentalement à un ordinateur de faire ?
L'accès direct à la mémoire à distance déplace les données directement entre la mémoire de deux nœuds, en contournant les copies du noyau du système d'exploitation et du processeur, ce qui réduit la latence et libère les cycles du processeur.
Pourquoi InfiniBand atteint-il une latence bien inférieure à celle des réseaux TCP/IP ordinaires ?
Les adaptateurs InfiniBand transfèrent les données directement vers/depuis la mémoire épinglée dans le matériel et contournent le noyau du système d'exploitation, éliminant ainsi les interruptions du processeur et les copies de données par paquet.
Quelle est environ la bande passante par liaison fournie par NDR InfiniBand ?
NDR (Next Data Rate) InfiniBand fonctionne à 400 Gb/s par liaison, XDR ciblant 800 Gb/s dans la prochaine génération.
Dans RDMA, à quoi servent les « paires de files d'attente » ?
Les applications publient des demandes de travail pour envoyer et recevoir des files d'attente (paires de files d'attente) ; l'adaptateur de canal hôte les lit et effectue les transferts de mémoire directs.
Qu’est-ce que le RoCE ?
RoCE signifie RDMA over Converged Ethernet, permettant des transferts à faible latence et sans noyau sur des structures Ethernet standard au lieu d'InfiniBand natif.