Technischer Leitfaden

InfiniBand- und RDMA-Netzwerke

InfiniBand ist eine Hochgeschwindigkeitsverbindung mit geringer Latenz, die Server und GPUs in KI-Clustern verbindet, und RDMA ermöglicht es einer Maschine, den Speicher einer anderen Maschine zu lesen oder zu schreiben, ohne die CPU einzubeziehen.

  • 2 Minuten gelesen
  • Zuletzt aktualisiert
Auf dieser Seite2 Minuten gelesen
  1. Übersicht
  2. Tiefer Einblick
  3. Strategische Auswirkungen
  4. Die Zukunft von InfiniBand und RDMA-Netzwerken
  5. Reale Umsetzung
  6. Risiken und Leitplanken
  7. Implementierungs-Roadmap
  8. Entdecken Sie weiter
  9. Häufig gestellte Fragen

Übersicht

Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.

Tiefer Einblick

Wenn Sie ein Modell auf Tausenden von GPUs trainieren, wird häufig das Netzwerk zum Engpass und nicht die Chips. InfiniBand ist eine Switched-Fabric, die speziell für diesen Zweck entwickelt wurde: Sie bietet pro Link eine Bandbreite von Hunderten von Gigabit pro Sekunde (NDR läuft mit 400 Gbit/s) und eine Latenz im Mikrosekundenbereich. Sein Schlüsseltrick ist Remote Direct Memory Access (RDMA), der Daten direkt zwischen dem Speicher zweier Knoten verschiebt und dabei den Betriebssystemkern und die CPU-Kopien umgeht, die normales TCP/IP verlangsamen. Dieser „Kernel-Bypass“ gibt CPU-Zyklen frei und verkürzt die Latenz. InfiniBand bietet außerdem Hardware-Flusskontrolle für eine verlustfreie Fabric, und NVIDIAs Quantum-Switches plus ConnectX-Adapter dominieren KI-Supercomputer. RoCE (RDMA over Converged Ethernet) bringt ähnliche RDMA-Vorteile für Ethernet-Netzwerke.

Strategische Auswirkungen

Kosten und Budget

Architekturentscheidungen beeinflussen über Jahre hinweg die Leistung und die Betriebskosten.

Klarere Entscheidungen

Technische Schulungen helfen Teams dabei, den richtigen Stack auszuwählen, nicht nur den neuesten.

Qualitätskontrolle

Bessere technische Entscheidungen reduzieren Zuverlässigkeitsvorfälle in der Produktion.

Die Zukunft von InfiniBand und RDMA-Netzwerken

Die Bandbreite steigt weiter: XDR InfiniBand strebt 800 Gbit/s pro Link an, mit Plänen für 1,6 Tbit/s. Der Wettbewerb verschärft sich, da das Ultra Ethernet Consortium Ethernet entwickelt, das zu InfiniBand für KI-Workloads passt, und da In-Network Computing (SHARP) kollektive Mathematik in die Switches selbst verlagert. Erwarten Sie eine engere GPU-Netzwerk-Integration, optische Verbindungen zur Stromreduzierung und Strukturen, die auf Cluster von Hunderttausenden von Beschleunigern skaliert werden, wenn Grenzmodelle wachsen.

Reale Umsetzung

Verbinden Sie Tausende von GPUs in einem KI-Supercomputer, sodass Gradientendaten während des verteilten Trainings in Mikrosekunden zwischen Knoten übertragen werden

Ermöglichen, dass ein Server den Speicher eines anderen Servers direkt liest (RDMA), um verteilte Dateisysteme und Datenbanken ohne CPU-Overhead zu beschleunigen

Ausführen von NCCL-All-Reduction-Operationen über InfiniBand, um Modellgewichtungen in einem GPU-Cluster zu synchronisieren

Verwendung von RoCE, um Übertragungen im RDMA-Stil mit geringer Latenz in bestehende Ethernet-Rechenzentrumsnetzwerke zu integrieren

Risiken und Leitplanken

  • Die Optimierung eines Benchmarks kann umfassendere Systemschwächen verbergen.

  • Infrastruktur- und Wartungskosten werden oft unterschätzt.

  • Sicherheits- und Beobachtbarkeitslücken können größer werden, wenn die Systeme komplexer werden.

Implementierungs-Roadmap

  1. Definieren Sie vor der Implementierung Latenz-, Qualitäts- und Kostenziele.

  2. Benchmark unter realistischen Last- und Datenbedingungen.

  3. Instrumentenüberwachung auf Fehler, Drift und Benutzereinflüsse.

  4. Bereiten Sie vor der Skalierung Rollback- und Incident-Response-Pfade vor.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InfiniBand and RDMA Networking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Häufig gestellte Fragen

What is InfiniBand and RDMA Networking?

InfiniBand ist eine Hochgeschwindigkeitsverbindung mit geringer Latenz, die Server und GPUs in KI-Clustern verbindet, und RDMA ermöglicht es einer Maschine, den Speicher einer anderen Maschine zu lesen oder zu schreiben, ohne die CPU einzubeziehen. Zusammen bilden sie das System, das Tausende von GPUs während des Trainings großer Modelle mit Daten versorgt.

Was ermöglicht RDMA grundsätzlich einem Computer?

Remote Direct Memory Access verschiebt Daten direkt zwischen dem Speicher zweier Knoten und umgeht dabei den Betriebssystemkern und die CPU-Kopien, wodurch die Latenz verkürzt und CPU-Zyklen freigegeben werden.

Warum erreicht InfiniBand eine viel geringere Latenz als herkömmliche TCP/IP-Netzwerke?

InfiniBand-Adapter übertragen Daten direkt zum/vom fixierten Speicher in der Hardware und umgehen den Betriebssystemkernel, wodurch CPU-Interrupts und Datenkopien pro Paket vermieden werden.

Welche Bandbreite pro Link bietet NDR InfiniBand ungefähr?

NDR (Next Data Rate) InfiniBand läuft mit 400 Gbit/s pro Link, wobei XDR in der nächsten Generation 800 Gbit/s anstrebt.

Wofür werden in RDMA „Warteschlangenpaare“ verwendet?

Anwendungen posten Arbeitsanforderungen an Sende- und Empfangswarteschlangen (Warteschlangenpaare); Der Host-Channel-Adapter liest sie und führt die direkten Speicherübertragungen durch.

Was ist RoCE?

RoCE steht für RDMA over Converged Ethernet und ermöglicht Kernel-Bypass-Übertragungen mit geringer Latenz auf Standard-Ethernet-Fabrics anstelle von nativem InfiniBand.