Teknisk GUIDE

InfiniBand och RDMA-nätverk

InfiniBand är en sammankoppling med hög hastighet och låg latens som länkar servrar och GPU:er i AI-kluster, och RDMA låter en maskin läsa eller skriva en annans minne utan att involvera CPU:n.

2 min readSenast uppdaterad

Översikt

Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.

Djupdykning

När du tränar en modell över tusentals GPU:er blir nätverket ofta flaskhalsen, inte chipsen. InfiniBand är ett switchat tyg specialbyggt för detta: det erbjuder bandbredd per länk i hundratals gigabit per sekund (NDR körs med 400 Gb/s) och latens i mikrosekundersskala. Dess nyckeltrick är Remote Direct Memory Access (RDMA), som flyttar data direkt mellan minnet på två noder, förbi operativsystemets kärna och CPU-kopior som gör vanlig TCP/IP långsammare. Denna 'kärnbypass' frigör CPU-cykler och minskar latensen. InfiniBand tillhandahåller också hårdvaruflödeskontroll för ett förlustfritt tyg, och NVIDIAs Quantum-switchar plus ConnectX-adaptrar dominerar AI-superdatorer. RoCE (RDMA over Converged Ethernet) ger liknande RDMA-fördelar till Ethernet-nätverk.

Teknisk insikt

RDMA fungerar genom verb och köpar. En ansökan lägger upp arbetsförfrågningar för att skicka och ta emot köer; nätverksadaptern (HCA) läser dem och överför data direkt till förregistrerade, fästa minnesområden på fjärrvärden. Eftersom NIC hanterar överföringen i hårdvara och OS-kärnan förbigås, finns det noll datakopior och inga CPU-avbrott per paket för bulköverföringen. InfiniBands länklagers kreditbaserade flödeskontroll förhindrar buffertspill, vilket gör tyget förlustfritt utan återsändningsstormar.

Strategisk inverkan

Cost and budget

Arkitekturbeslut driver prestanda och driftskostnader i flera år.

Clearer decisions

Teknisk utbildning hjälper team att välja rätt stack, inte bara den nyaste.

Quality control

Bättre tekniska val minskar tillförlitlighetsincidenter i produktionen.

Framtiden för InfiniBand och RDMA-nätverk

Bandbredden fortsätter att klättra: XDR InfiniBand siktar på 800 Gb/s per länk, med färdplaner mot 1,6 Tb/s. Konkurrensen intensifieras när Ultra Ethernet Consortium designar Ethernet som matchar InfiniBand för AI-arbetsbelastningar, och eftersom in-network computing (SHARP) laddar av kollektiv matematik till själva switcharna. Förvänta dig stramare GPU-till-nätverk-integration, optiska sammankopplingar för att minska strömmen och tyger skalade till kluster av hundratusentals acceleratorer när frontier-modeller växer.

Real-World Implementation

Anslut tusentals GPU:er i en AI-superdator så att gradientdata flyttas mellan noder på mikrosekunder under distribuerad träning

Att låta en server läsa en annans minne direkt (RDMA) för att accelerera distribuerade filsystem och databaser utan CPU-overhead

Kör NCCL all-reduce-operationer över InfiniBand för att synkronisera modellvikter över ett GPU-kluster

Använder RoCE för att föra överföringar med låg latens i RDMA-stil till befintliga Ethernet-datacenternätverk

Risker & skyddsräcken

Att optimera ett riktmärke kan dölja bredare systemsvagheter.

Infrastruktur- och underhållskostnader underskattas ofta.

Säkerhets- och observerbarhetsluckor kan växa i takt med att systemen blir mer komplexa.

Färdplan för genomförande

1

Definiera latens-, kvalitet- och kostnadsmål före implementering.

2

Benchmark under realistiska belastnings- och dataförhållanden.

3

Instrumentövervakning för fel, drift och användarpåverkan.

4

Förbered återställnings- och incidentsvarsvägar innan skalning.

Fortsätt utforska

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InfiniBand and RDMA Networking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Starta frågesport

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Feature Engineering Pipelines och dataversionering

Frequently asked questions

What is InfiniBand and RDMA Networking?

InfiniBand är en sammankoppling med hög hastighet och låg latens som länkar servrar och GPU:er i AI-kluster, och RDMA låter en maskin läsa eller skriva en annans minne utan att involvera CPU:n. Tillsammans är de rören som håller tusentals GPU:er matade med data under utbildning i stora modeller.

Vad tillåter RDMA i grunden en dator att göra?

Remote Direct Memory Access flyttar data rakt mellan minnet på två noder, och kringgår OS-kärnan och CPU-kopiorna, vilket minskar latensen och frigör CPU-cykler.

Varför uppnår InfiniBand mycket lägre latens än vanliga TCP/IP-nätverk?

InfiniBand-adaptrar överför data direkt till/från fastnat minne i hårdvaran och kringgår OS-kärnan, vilket eliminerar CPU-avbrott per paket och datakopior.

Ungefär vilken bandbredd per länk ger NDR InfiniBand?

NDR (Next Data Rate) InfiniBand körs med 400 Gb/s per länk, med XDR inriktning på 800 Gb/s i nästa generation.

Vad används "köpar" till i RDMA?

Ansökningar skickar arbetsförfrågningar om att skicka och ta emot köer (köpar); värdkanaladaptern läser dem och utför de direkta minnesöverföringarna.

Vad är RoCE?

RoCE står för RDMA over Converged Ethernet, vilket tillåter låg latens, kernel-bypass-överföringar på standard Ethernet-tyger istället för inbyggt InfiniBand.