GUIDE Technique

Réseau InfiniBand et RDMA

InfiniBand est une interconnexion à haut débit et à faible latence qui relie les serveurs et les GPU dans des clusters d'IA, et RDMA permet à une machine de lire ou d'écrire la mémoire d'une autre sans impliquer le processeur.

2 minutes de lectureDernière mise à jour

Aperçu

Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.

Plongée profonde

Lorsque vous entraînez un modèle sur des milliers de GPU, c'est souvent le réseau qui devient le goulot d'étranglement, et non les puces. InfiniBand est une structure commutée spécialement conçue à cet effet : elle offre une bande passante par liaison de l'ordre de centaines de gigabits par seconde (NDR fonctionne à 400 Gb/s) et une latence à l'échelle de la microseconde. Son astuce clé est l'accès direct à la mémoire à distance (RDMA), qui déplace les données directement entre la mémoire de deux nœuds, en contournant le noyau du système d'exploitation et les copies du processeur qui ralentissent le TCP/IP ordinaire. Ce « contournement du noyau » libère les cycles du processeur et réduit la latence. InfiniBand fournit également un contrôle de flux matériel pour une structure sans perte, et les commutateurs Quantum de NVIDIA ainsi que les adaptateurs ConnectX dominent les supercalculateurs IA. RoCE (RDMA over Converged Ethernet) apporte des avantages RDMA similaires aux réseaux Ethernet.

Aperçu technique

RDMA fonctionne via des verbes et des paires de files d'attente. Une application publie des demandes de travail pour envoyer et recevoir des files d'attente ; l'adaptateur réseau (le HCA) les lit et transfère les données directement dans des régions de mémoire préenregistrées et épinglées sur l'hôte distant. Étant donné que la carte réseau gère le transfert matériel et que le noyau du système d'exploitation est contourné, il n'y a aucune copie de données et aucune interruption du processeur par paquet pour le transfert en masse. Le contrôle de flux basé sur le crédit au niveau de la couche liaison d'InfiniBand empêche le débordement de la mémoire tampon, rendant la structure sans perte et sans tempêtes de retransmission.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L'avenir des réseaux InfiniBand et RDMA

La bande passante ne cesse de grimper : XDR InfiniBand vise 800 Gb/s par liaison, avec des feuilles de route vers 1,6 Tb/s. La concurrence s'intensifie à mesure que l'Ultra Ethernet Consortium conçoit un Ethernet qui correspond à InfiniBand pour les charges de travail d'IA, et que l'informatique en réseau (SHARP) transfère les mathématiques collectives vers les commutateurs eux-mêmes. Attendez-vous à une intégration GPU-réseau plus étroite, à des interconnexions optiques pour couper l’alimentation et à des structures adaptées à des clusters de centaines de milliers d’accélérateurs à mesure que les modèles de pointe se développent.

Mise en œuvre dans le monde réel

Connecter des milliers de GPU dans un supercalculateur IA afin que les données de gradient se déplacent entre les nœuds en microsecondes pendant l'entraînement distribué

Permettre à un serveur de lire directement la mémoire d'un autre (RDMA) pour accélérer les systèmes de fichiers distribués et les bases de données sans surcharge du processeur

Exécution d'opérations de réduction totale NCCL sur InfiniBand pour synchroniser les poids de modèle sur un cluster GPU

Utilisation de RoCE pour apporter des transferts à faible latence de type RDMA aux réseaux de centres de données Ethernet existants

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InfiniBand and RDMA Networking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Pipelines d’ingénierie de fonctionnalités et gestion des versions de données

Questions fréquemment posées

What is InfiniBand and RDMA Networking?

InfiniBand est une interconnexion à haut débit et à faible latence qui relie les serveurs et les GPU dans des clusters d'IA, et RDMA permet à une machine de lire ou d'écrire la mémoire d'une autre sans impliquer le processeur. Ensemble, ils constituent la plomberie qui permet à des milliers de GPU d'être alimentés en données pendant la formation de grands modèles.

Qu'est-ce que RDMA permet fondamentalement à un ordinateur de faire ?

L'accès direct à la mémoire à distance déplace les données directement entre la mémoire de deux nœuds, en contournant les copies du noyau du système d'exploitation et du processeur, ce qui réduit la latence et libère les cycles du processeur.

Pourquoi InfiniBand atteint-il une latence bien inférieure à celle des réseaux TCP/IP ordinaires ?

Les adaptateurs InfiniBand transfèrent les données directement vers/depuis la mémoire épinglée dans le matériel et contournent le noyau du système d'exploitation, éliminant ainsi les interruptions du processeur et les copies de données par paquet.

Quelle est environ la bande passante par liaison fournie par NDR InfiniBand ?

NDR (Next Data Rate) InfiniBand fonctionne à 400 Gb/s par liaison, XDR ciblant 800 Gb/s dans la prochaine génération.

Dans RDMA, à quoi servent les « paires de files d'attente » ?

Les applications publient des demandes de travail pour envoyer et recevoir des files d'attente (paires de files d'attente) ; l'adaptateur de canal hôte les lit et effectue les transferts de mémoire directs.

Qu’est-ce que le RoCE ?

RoCE signifie RDMA over Converged Ethernet, permettant des transferts à faible latence et sans noyau sur des structures Ethernet standard au lieu d'InfiniBand natif.