Rețea InfiniBand și RDMA
InfiniBand este o interconexiune de mare viteză, cu latență scăzută, care conectează serverele și GPU-urile în clustere AI, iar RDMA permite unei mașini să citească sau să scrie memoria alteia fără a implica CPU.
Prezentare generală
Împreună, ele sunt conducta care menține mii de GPU-uri alimentate cu date în timpul antrenamentelor pe modele mari.
Scufundare în profunzime
Când antrenați un model pe mii de GPU-uri, rețeaua devine adesea blocajul, nu cipurile. InfiniBand este o țesătură comutată special creată pentru acest lucru: oferă lățime de bandă pe legătură în sute de gigabiți pe secundă (NDR rulează la 400 Gb/s) și latență la scară de microsecunde. Trucul său cheie este Remote Direct Memory Access (RDMA), care mută datele direct între memoria a două noduri, ocolind nucleul sistemului de operare și copiile CPU care încetinesc TCP/IP obișnuit. Această „ocolire a nucleului” eliberează ciclurile CPU și reduce latența. InfiniBand oferă, de asemenea, controlul fluxului hardware pentru o țesătură fără pierderi, iar comutatoarele Quantum de la NVIDIA plus adaptoarele ConnectX domină supercalculatoarele AI. RoCE (RDMA over Converged Ethernet) aduce beneficii RDMA similare rețelelor Ethernet.
Perspectivă tehnică
RDMA funcționează prin verbe și perechi de coadă. O aplicație postează solicitări de lucru pentru a trimite și a primi cozi; adaptorul de rețea (HCA) le citește și transferă date direct în regiunile de memorie preînregistrate, fixate pe gazda la distanță. Deoarece NIC-ul se ocupă de transferul în hardware și kernel-ul sistemului de operare este ocolit, nu există copii de date zero și nu există întreruperi CPU per pachet pentru transferul în bloc. Controlul fluxului bazat pe credit al stratului de legătură al InfiniBand previne depășirea tamponului, făcând materialul fără pierderi fără furtuni de retransmisie.
Impact strategic
Cost și buget
Deciziile de arhitectură generează performanța și costurile de operare de ani de zile.
Decizii mai clare
Educația tehnică ajută echipele să aleagă stiva potrivită, nu doar cea mai nouă.
Controlul calității
Opțiuni de inginerie mai bune reduc incidentele de fiabilitate în producție.
Viitorul rețelelor InfiniBand și RDMA
Lățimea de bandă continuă să crească: XDR InfiniBand vizează 800 Gb/s per legătură, cu foi de parcurs spre 1,6 Tb/s. Concurența se intensifică pe măsură ce Consorțiul Ultra Ethernet proiectează Ethernet care se potrivește cu InfiniBand pentru sarcinile de lucru AI și pe măsură ce calculul în rețea (SHARP) descarcă matematica colectivă în comutatoarele în sine. Așteptați-vă la o integrare mai strânsă între GPU și rețea, interconexiuni optice pentru a reduce puterea și țesături scalate la grupuri de sute de mii de acceleratoare pe măsură ce modelele de frontieră cresc.
Implementare în lumea reală
Conectarea a mii de GPU într-un supercomputer AI, astfel încât datele de gradient să se deplaseze între noduri în microsecunde în timpul antrenamentului distribuit
Permiterea unui server să citească memoria altuia direct (RDMA) pentru a accelera sistemele de fișiere distribuite și bazele de date fără suprasolicitare CPU
Rularea operațiunilor de reducere totală NCCL prin InfiniBand pentru a sincroniza greutățile modelului într-un cluster GPU
Utilizarea RoCE pentru a aduce transferuri cu latență scăzută în stil RDMA către rețelele existente de centre de date Ethernet
Riscuri și balustrade
Optimizarea unui punct de referință poate ascunde slăbiciunile mai largi ale sistemului.
Costurile de infrastructură și întreținere sunt adesea subestimate.
Lacunele de securitate și observabilitate pot crește pe măsură ce sistemele devin mai complexe.
Foaia de parcurs de implementare
Definiți obiectivele de latență, calitate și cost înainte de implementare.
Benchmark în condiții realiste de încărcare și date.
Monitorizarea instrumentelor pentru erori, deriva și impactul utilizatorului.
Pregătiți căile de retragere și răspuns la incident înainte de scalare.
Continuați să explorați
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the InfiniBand and RDMA Networking quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Următorul ghid
Caracteristică Conducte de inginerie și versiunea datelor
Întrebări frecvente
Ce este InfiniBand și rețeaua RDMA?
InfiniBand este o interconexiune de mare viteză, cu latență scăzută, care conectează serverele și GPU-urile în clustere AI, iar RDMA permite unei mașini să citească sau să scrie memoria alteia fără a implica CPU. Împreună, ele sunt instalațiile care mențin mii de GPU-uri alimentate cu date în timpul antrenamentului pentru modele mari.
Ce permite în mod fundamental RDMA să facă un computer?
Accesul direct la memorie la distanță mută datele direct între memoria a două noduri, ocolind nucleul sistemului de operare și copiile CPU, ceea ce reduce latența și eliberează ciclurile CPU.
De ce InfiniBand atinge o latență mult mai mică decât o rețea TCP/IP obișnuită?
Adaptoarele InfiniBand transferă date direct către/din memoria fixată în hardware și ocolesc nucleul sistemului de operare, eliminând întreruperile CPU per pachet și copiile de date.
Aproximativ ce lățime de bandă pe legătură oferă NDR InfiniBand?
NDR (Next Data Rate) InfiniBand rulează la 400 Gb/s per legătură, cu XDR țintind 800 Gb/s în următoarea generație.
În RDMA, pentru ce sunt folosite „perechile de coadă”?
Aplicațiile postează solicitări de lucru pentru a trimite și primi cozi (perechi de cozi); adaptorul de canal gazdă le citește și efectuează transferurile directe de memorie.
Ce este RoCE?
RoCE reprezintă RDMA over Converged Ethernet, permițând transferuri cu o latență scăzută, de ocolire a nucleului pe fabricile Ethernet standard în loc de InfiniBand nativ.