Sieć InfiniBand i RDMA
InfiniBand to szybkie połączenie wzajemne o niskim opóźnieniu, które łączy serwery i procesory graficzne w klastrach AI, a RDMA umożliwia jednej maszynie odczytywanie lub zapisywanie pamięci innej bez angażowania procesora.
Przegląd
Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.
Głębokie nurkowanie
Kiedy trenujesz model na tysiącach procesorów graficznych, wąskim gardłem często staje się sieć, a nie chipy. InfiniBand jest siecią przełączaną stworzoną specjalnie do tego celu: oferuje przepustowość na łącze rzędu setek gigabitów na sekundę (NDR działa z szybkością 400 Gb/s) i opóźnienia w skali mikrosekund. Jego kluczową sztuczką jest zdalny bezpośredni dostęp do pamięci (RDMA), który przenosi dane bezpośrednio między pamięcią dwóch węzłów, omijając kopie jądra systemu operacyjnego i procesora, które spowalniają zwykły protokół TCP/IP. To „obejście jądra” uwalnia cykle procesora i zmniejsza opóźnienia. InfiniBand zapewnia także sprzętową kontrolę przepływu w bezstratnej strukturze, a przełączniki Quantum firmy NVIDIA i adaptery ConnectX dominują w superkomputerach AI. RoCE (RDMA over Converged Ethernet) zapewnia podobne korzyści RDMA w sieciach Ethernet.
Wgląd techniczny
RDMA działa poprzez czasowniki i pary kolejek. Aplikacja publikuje żądania pracy w celu wysyłania i odbierania kolejek; karta sieciowa (HCA) odczytuje je i przesyła dane bezpośrednio do wstępnie zarejestrowanych, przypiętych obszarów pamięci na zdalnym hoście. Ponieważ karta sieciowa obsługuje transfer sprzętowo, a jądro systemu operacyjnego jest omijane, nie ma kopii danych i nie ma żadnych przerwań procesora przypadających na pakiet w przypadku transferu zbiorczego. Kontrola przepływu w warstwie łącza InfiniBand oparta na kredytach zapobiega przepełnieniu bufora, dzięki czemu sieć szkieletowa jest bezstratna i pozbawiona burz retransmisyjnych.
Wpływ strategiczny
Koszt i budżet
Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.
Jaśniejsze decyzje
Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.
Kontrola jakości
Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.
Przyszłość sieci InfiniBand i RDMA
Przepustowość stale rośnie: XDR InfiniBand planuje osiągnąć prędkość 800 Gb/s na łącze, a plany mają osiągnąć 1,6 Tb/s. Konkurencja nasila się, ponieważ konsorcjum Ultra Ethernet projektuje sieć Ethernet dostosowaną do InfiniBand pod kątem obciążeń AI, a przetwarzanie w sieci (SHARP) przenosi zbiorową matematykę na same przełączniki. Spodziewaj się ściślejszej integracji procesora graficznego z siecią, optycznych połączeń wzajemnych ograniczających pobór mocy oraz sieci szkieletowych skalowanych do klastrów setek tysięcy akceleratorów w miarę rozwoju pionierskich modeli.
Implementacja w świecie rzeczywistym
Łączenie tysięcy procesorów graficznych w superkomputerze AI, aby dane gradientowe przemieszczały się między węzłami w ciągu mikrosekund podczas rozproszonego szkolenia
Umożliwienie jednemu serwerowi bezpośredniego odczytu pamięci innego (RDMA) w celu przyspieszenia rozproszonych systemów plików i baz danych bez obciążania procesora
Uruchamianie operacji NCCL all-reduce przez InfiniBand w celu synchronizacji wag modeli w klastrze GPU
Korzystanie z RoCE w celu zapewnienia transferów o niskim opóźnieniu w stylu RDMA do istniejących sieci Ethernet w centrach danych
Zagrożenia i poręcze
Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.
Koszty infrastruktury i utrzymania są często niedoszacowane.
W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.
Plan wdrożenia
Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.
Test porównawczy w realistycznych warunkach obciążenia i danych.
Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.
Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the InfiniBand and RDMA Networking quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Potoki inżynierii funkcji i wersjonowanie danych
Często zadawane pytania
What is InfiniBand and RDMA Networking?
InfiniBand to szybkie połączenie wzajemne o niskim opóźnieniu, które łączy serwery i procesory graficzne w klastrach AI, a RDMA umożliwia jednej maszynie odczytywanie lub zapisywanie pamięci innej bez angażowania procesora. Razem stanowią one łącznik, który zasila tysiące procesorów graficznych danymi podczas uczenia dużych modeli.
Na co zasadniczo RDMA pozwala jednemu komputerowi?
Zdalny bezpośredni dostęp do pamięci przenosi dane bezpośrednio między pamięcią dwóch węzłów, omijając jądro systemu operacyjnego i kopie procesora, co zmniejsza opóźnienia i uwalnia cykle procesora.
Dlaczego InfiniBand osiąga znacznie mniejsze opóźnienia niż zwykła sieć TCP/IP?
Adaptery InfiniBand przesyłają dane bezpośrednio do/z przypiętej pamięci sprzętowej i omijają jądro systemu operacyjnego, eliminując przerwania procesora na pakiet i kopie danych.
Jaką mniej więcej przepustowość na łącze zapewnia NDR InfiniBand?
NDR (Next Data Rate) InfiniBand działa z szybkością 400 Gb/s na łącze, a XDR ma osiągnąć 800 Gb/s w następnej generacji.
Do czego w RDMA służą „pary kolejek”?
Aplikacje publikują żądania pracy w celu wysyłania i odbierania kolejek (par kolejek); adapter kanału hosta odczytuje je i wykonuje bezpośrednie transfery pamięci.
Co to jest RoCE?
RoCE oznacza RDMA over Converged Ethernet, umożliwiając transfery z niskim opóźnieniem i obejściem jądra w standardowych strukturach Ethernet zamiast natywnej InfiniBand.