Teknisk GUIDE

InfiniBand og RDMA-nettverk

InfiniBand er en høyhastighets sammenkobling med lav latens som kobler sammen servere og GPUer i AI-klynger, og RDMA lar én maskin lese eller skrive en annens minne uten å involvere CPU-en.

2 min lesingSist oppdatert

Oversikt

Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.

Dypdykk

Når du trener en modell på tvers av tusenvis av GPUer, blir nettverket ofte flaskehalsen, ikke brikkene. InfiniBand er et svitsjet stoff spesialbygget for dette: det tilbyr båndbredde per lenke i hundrevis av gigabit per sekund (NDR kjører med 400 Gb/s) og mikrosekunders-skala-latens. Nøkkeltrikset er Remote Direct Memory Access (RDMA), som flytter data direkte mellom minnet til to noder, og omgår operativsystemkjernen og CPU-kopier som bremser vanlig TCP/IP. Denne 'kjernebypass' frigjør CPU-sykluser og reduserer ventetiden. InfiniBand gir også maskinvareflytkontroll for et tapsfritt stoff, og NVIDIAs Quantum-svitsjer pluss ConnectX-adaptere dominerer AI-superdatamaskiner. RoCE (RDMA over Converged Ethernet) gir lignende RDMA-fordeler til Ethernet-nettverk.

Teknisk innsikt

RDMA fungerer gjennom verb og køpar. En søknad legger ut arbeidsforespørsler om å sende og motta køer; nettverksadapteren (HCA) leser dem og overfører data direkte til forhåndsregistrerte, festede minneområder på den eksterne verten. Fordi NIC håndterer overføringen i maskinvare og OS-kjernen omgås, er det null datakopier og ingen CPU-avbrudd per pakke for bulkoverføringen. InfiniBands link-layer kredittbaserte flytkontroll forhindrer bufferoverløp, noe som gjør stoffet tapsfritt uten retransmissionsstormer.

Strategisk innvirkning

Cost and budget

Arkitekturbeslutninger driver ytelse og driftskostnader i årevis.

Tydeligere avgjørelser

Teknisk utdanning hjelper team med å velge riktig stabel, ikke bare den nyeste.

Quality control

Bedre ingeniørvalg reduserer pålitelighetshendelser i produksjonen.

Fremtiden til InfiniBand og RDMA-nettverk

Båndbredden fortsetter å klatre: XDR InfiniBand målretter seg mot 800 Gb/s per lenke, med veikart mot 1,6 Tb/s. Konkurransen tiltar etter hvert som Ultra Ethernet Consortium designer Ethernet som matcher InfiniBand for AI-arbeidsbelastninger, og ettersom in-network computing (SHARP) laster av kollektiv matematikk inn i selve svitsjene. Forvent tettere GPU-til-nettverk-integrasjon, optiske sammenkoblinger for å kutte strøm, og stoffer skalert til klynger på hundretusenvis av akseleratorer etter hvert som frontier-modeller vokser.

Real-World Implementering

Koble til tusenvis av GPUer i en AI-superdatamaskin slik at gradientdata beveger seg mellom noder på mikrosekunder under distribuert trening

Å la en server lese en annens minne direkte (RDMA) for å akselerere distribuerte filsystemer og databaser uten CPU-overhead

Kjører NCCL all-reduce-operasjoner over InfiniBand for å synkronisere modellvekter på tvers av en GPU-klynge

Bruk av RoCE for å bringe overføringer med lav latens i RDMA-stil til eksisterende Ethernet-datasenternettverk

Risikoer og rekkverk

Optimalisering av ett benchmark kan skjule bredere systemsvakheter.

Infrastruktur- og vedlikeholdskostnader er ofte undervurdert.

Sikkerhets- og observerbarhetsgap kan vokse etter hvert som systemene blir mer komplekse.

Veikart for implementering

1

Definer ventetid, kvalitet og kostnadsmål før implementering.

2

Benchmark under realistiske belastnings- og dataforhold.

3

Instrumentovervåking for feil, drift og brukerpåvirkning.

4

Forbered tilbakerulling og hendelsesresponsbaner før skalering.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InfiniBand and RDMA Networking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

Feature Engineering Pipelines og dataversjon

Ofte stilte spørsmål

What is InfiniBand and RDMA Networking?

InfiniBand er en høyhastighets sammenkobling med lav latens som kobler sammen servere og GPUer i AI-klynger, og RDMA lar én maskin lese eller skrive en annens minne uten å involvere CPU-en. Sammen er de rørleggerarbeidene som holder tusenvis av GPU-er matet med data under opplæring av store modeller.

Hva lar RDMA i utgangspunktet én datamaskin gjøre?

Ekstern direkte minnetilgang flytter data rett mellom minnet til to noder, og omgår OS-kjernen og CPU-kopier, noe som reduserer ventetiden og frigjør CPU-sykluser.

Hvorfor oppnår InfiniBand mye lavere ventetid enn vanlig TCP/IP-nettverk?

InfiniBand-adaptere overfører data direkte til/fra festet minne i maskinvaren og omgår OS-kjernen, og eliminerer CPU-avbrudd og datakopier per pakke.

Omtrent hvilken båndbredde per lenke gir NDR InfiniBand?

NDR (Next Data Rate) InfiniBand kjører med 400 Gb/s per kobling, med XDR målrettet mot 800 Gb/s i neste generasjon.

Hva brukes 'køpar' til i RDMA?

Applikasjoner legger ut arbeidsforespørsler om å sende og motta køer (køpar); vertskanaladapteren leser dem og utfører de direkte minneoverføringene.

Hva er RoCE?

RoCE står for RDMA over Converged Ethernet, og tillater kjernebypass-overføringer med lav latens på standard Ethernet-stoffer i stedet for native InfiniBand.