InfiniBand és RDMA hálózat
Az InfiniBand egy nagy sebességű, alacsony késleltetésű összekapcsolás, amely AI-fürtökben köti össze a szervereket és a GPU-kat, az RDMA pedig lehetővé teszi az egyik gép számára, hogy a CPU bevonása nélkül olvassa vagy írjon egy másik memóriáját.
Áttekintés
Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.
Mély merülés
Amikor egy modellt több ezer GPU-n keresztül tanít, gyakran a hálózat lesz a szűk keresztmetszet, nem pedig a chipek. Az InfiniBand egy kapcsolt szövet erre a célra: linkenkénti sávszélességet kínál több száz gigabit/s sávszélességgel (400 Gb/s-on fut az NDR) és mikromásodperces késleltetést. A legfontosabb trükk a Remote Direct Memory Access (RDMA), amely közvetlenül mozgatja az adatokat két csomópont memóriája között, megkerülve az operációs rendszer kernelt és a CPU-másolatokat, amelyek lassítják a hagyományos TCP/IP-t. Ez a „kernel bypass” felszabadítja a CPU ciklusait és csökkenti a várakozási időt. Az InfiniBand hardveres áramlásvezérlést is biztosít a veszteségmentes szövethez, és az NVIDIA Quantum switchei és ConnectX adapterei uralják az AI szuperszámítógépeket. A RoCE (RDMA over Converged Ethernet) hasonló RDMA-előnyöket biztosít az Ethernet hálózatok számára.
Technikai betekintés
Az RDMA igéken és sorpárokon keresztül működik. Egy alkalmazás munkakéréseket tesz közzé sorok küldésére és fogadására; a hálózati adapter (a HCA) beolvassa őket, és közvetlenül továbbítja az adatokat a távoli gazdagép előre regisztrált, rögzített memóriaterületeibe. Mivel a hálózati kártya hardveresen kezeli az átvitelt, és az operációs rendszer kernelt kihagyják, nulla adatmásolat és nincs csomagonkénti CPU megszakítás a tömeges átvitelhez. Az InfiniBand link-layer kredit-alapú áramlásvezérlése megakadályozza a puffer túlcsordulást, így a szövet veszteségmentessé válik az újraküldési viharok nélkül.
Stratégiai hatás
Költség és költségvetés
Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.
Tisztább döntések
A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.
Minőségellenőrzés
A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.
Az InfiniBand és az RDMA hálózat jövője
A sávszélesség folyamatosan növekszik: az XDR InfiniBand 800 Gb/s sebességet céloz meg linkenként, az ütemterv pedig 1,6 Tb/s felé halad. A verseny erősödik, ahogy az Ultra Ethernet Konzorcium az InfiniBandhoz illeszkedő Ethernetet tervez az AI-munkaterhelésekhez, és ahogy a hálózaton belüli számítástechnika (SHARP) a kollektív matematikai számításokat magába a switch-be helyezi. A GPU-hálózat szorosabb integrációjára, az energiatakarékos optikai összeköttetésekre, valamint a több százezer gyorsítócsoportra méretezhető szövetekre számíthat, ahogy a határmodellek fejlődnek.
Valós megvalósítás
Több ezer GPU csatlakoztatása egy mesterséges intelligencia-szuperszámítógépben, így a gradiens adatok mikroszekundum alatt mozognak a csomópontok között az elosztott képzés során
Engedélyezi az egyik szervernek, hogy közvetlenül olvassa a másik memóriáját (RDMA), hogy felgyorsítsa az elosztott fájlrendszereket és adatbázisokat CPU-terhelés nélkül
Az NCCL minden csökkentése műveletek futtatása InfiniBandon keresztül a modellsúlyok szinkronizálásához a GPU-fürtök között
A RoCE használata az RDMA-stílusú alacsony késleltetésű átvitelek megvalósításához a meglévő Ethernet adatközponti hálózatokhoz
Kockázatok és védőkorlátok
Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.
Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.
A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.
Végrehajtási ütemterv
Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.
Benchmark reális terhelési és adatviszonyok mellett.
Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.
A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the InfiniBand and RDMA Networking quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Feature Engineering Pipelines és Data Versioning
Gyakran ismételt kérdések
What is InfiniBand and RDMA Networking?
Az InfiniBand egy nagy sebességű, alacsony késleltetésű összekapcsolás, amely AI-fürtökben köti össze a szervereket és a GPU-kat, az RDMA pedig lehetővé teszi az egyik gép számára, hogy a CPU bevonása nélkül olvassa vagy írjon egy másik memóriáját. Együtt ők jelentik azt a vízvezetéket, amely több ezer GPU-t lát el adatokkal a nagymodell-oktatás során.
Az RDMA alapvetően mit tesz lehetővé egy számítógép számára?
A Remote Direct Memory Access egyenesen mozgatja az adatokat két csomópont memóriája között, megkerülve az operációs rendszer kernelt és a CPU másolatait, ami csökkenti a késleltetést és felszabadítja a CPU ciklusokat.
Miért ér el az InfiniBand sokkal alacsonyabb késleltetést, mint a hagyományos TCP/IP hálózat?
Az InfiniBand adapterek közvetlenül a hardverben rögzített memóriába vagy onnan továbbítják az adatokat, és megkerülik az operációs rendszer kernelt, kiküszöbölve a csomagonkénti CPU megszakításokat és az adatmásolásokat.
Körülbelül mekkora linkenkénti sávszélességet biztosít az NDR InfiniBand?
Az NDR (Next Data Rate) InfiniBand 400 Gb/s sebességgel fut linkenként, az XDR pedig 800 Gb/s-ot céloz meg a következő generációban.
Az RDMA-ban mire használják a „sorpárokat”?
Az alkalmazások munkakéréseket tesznek közzé sorok (sorpárok) küldésére és fogadására; a gazdacsatorna-adapter beolvassa őket, és végrehajtja a közvetlen memóriaátvitelt.
Mi az a RoCE?
A RoCE az RDMA over Converged Ethernet rövidítése, amely alacsony késleltetésű, kernel-bypass átvitelt tesz lehetővé szabványos Ethernet szöveteken a natív InfiniBand helyett.