PRZEWODNIK techniczny

Sieć InfiniBand i RDMA

InfiniBand to szybkie połączenie wzajemne o niskim opóźnieniu, które łączy serwery i procesory graficzne w klastrach AI, a RDMA umożliwia jednej maszynie odczytywanie lub zapisywanie pamięci innej bez angażowania procesora.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.

Głębokie nurkowanie

Kiedy trenujesz model na tysiącach procesorów graficznych, wąskim gardłem często staje się sieć, a nie chipy. InfiniBand jest siecią przełączaną stworzoną specjalnie do tego celu: oferuje przepustowość na łącze rzędu setek gigabitów na sekundę (NDR działa z szybkością 400 Gb/s) i opóźnienia w skali mikrosekund. Jego kluczową sztuczką jest zdalny bezpośredni dostęp do pamięci (RDMA), który przenosi dane bezpośrednio między pamięcią dwóch węzłów, omijając kopie jądra systemu operacyjnego i procesora, które spowalniają zwykły protokół TCP/IP. To „obejście jądra” uwalnia cykle procesora i zmniejsza opóźnienia. InfiniBand zapewnia także sprzętową kontrolę przepływu w bezstratnej strukturze, a przełączniki Quantum firmy NVIDIA i adaptery ConnectX dominują w superkomputerach AI. RoCE (RDMA over Converged Ethernet) zapewnia podobne korzyści RDMA w sieciach Ethernet.

Wgląd techniczny

RDMA działa poprzez czasowniki i pary kolejek. Aplikacja publikuje żądania pracy w celu wysyłania i odbierania kolejek; karta sieciowa (HCA) odczytuje je i przesyła dane bezpośrednio do wstępnie zarejestrowanych, przypiętych obszarów pamięci na zdalnym hoście. Ponieważ karta sieciowa obsługuje transfer sprzętowo, a jądro systemu operacyjnego jest omijane, nie ma kopii danych i nie ma żadnych przerwań procesora przypadających na pakiet w przypadku transferu zbiorczego. Kontrola przepływu w warstwie łącza InfiniBand oparta na kredytach zapobiega przepełnieniu bufora, dzięki czemu sieć szkieletowa jest bezstratna i pozbawiona burz retransmisyjnych.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość sieci InfiniBand i RDMA

Przepustowość stale rośnie: XDR InfiniBand planuje osiągnąć prędkość 800 Gb/s na łącze, a plany mają osiągnąć 1,6 Tb/s. Konkurencja nasila się, ponieważ konsorcjum Ultra Ethernet projektuje sieć Ethernet dostosowaną do InfiniBand pod kątem obciążeń AI, a przetwarzanie w sieci (SHARP) przenosi zbiorową matematykę na same przełączniki. Spodziewaj się ściślejszej integracji procesora graficznego z siecią, optycznych połączeń wzajemnych ograniczających pobór mocy oraz sieci szkieletowych skalowanych do klastrów setek tysięcy akceleratorów w miarę rozwoju pionierskich modeli.

Implementacja w świecie rzeczywistym

Łączenie tysięcy procesorów graficznych w superkomputerze AI, aby dane gradientowe przemieszczały się między węzłami w ciągu mikrosekund podczas rozproszonego szkolenia

Umożliwienie jednemu serwerowi bezpośredniego odczytu pamięci innego (RDMA) w celu przyspieszenia rozproszonych systemów plików i baz danych bez obciążania procesora

Uruchamianie operacji NCCL all-reduce przez InfiniBand w celu synchronizacji wag modeli w klastrze GPU

Korzystanie z RoCE w celu zapewnienia transferów o niskim opóźnieniu w stylu RDMA do istniejących sieci Ethernet w centrach danych

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InfiniBand and RDMA Networking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Potoki inżynierii funkcji i wersjonowanie danych

Często zadawane pytania

What is InfiniBand and RDMA Networking?

InfiniBand to szybkie połączenie wzajemne o niskim opóźnieniu, które łączy serwery i procesory graficzne w klastrach AI, a RDMA umożliwia jednej maszynie odczytywanie lub zapisywanie pamięci innej bez angażowania procesora. Razem stanowią one łącznik, który zasila tysiące procesorów graficznych danymi podczas uczenia dużych modeli.

Na co zasadniczo RDMA pozwala jednemu komputerowi?

Zdalny bezpośredni dostęp do pamięci przenosi dane bezpośrednio między pamięcią dwóch węzłów, omijając jądro systemu operacyjnego i kopie procesora, co zmniejsza opóźnienia i uwalnia cykle procesora.

Dlaczego InfiniBand osiąga znacznie mniejsze opóźnienia niż zwykła sieć TCP/IP?

Adaptery InfiniBand przesyłają dane bezpośrednio do/z przypiętej pamięci sprzętowej i omijają jądro systemu operacyjnego, eliminując przerwania procesora na pakiet i kopie danych.

Jaką mniej więcej przepustowość na łącze zapewnia NDR InfiniBand?

NDR (Next Data Rate) InfiniBand działa z szybkością 400 Gb/s na łącze, a XDR ma osiągnąć 800 Gb/s w następnej generacji.

Do czego w RDMA służą „pary kolejek”?

Aplikacje publikują żądania pracy w celu wysyłania i odbierania kolejek (par kolejek); adapter kanału hosta odczytuje je i wykonuje bezpośrednie transfery pamięci.

Co to jest RoCE?

RoCE oznacza RDMA over Converged Ethernet, umożliwiając transfery z niskim opóźnieniem i obejściem jądra w standardowych strukturach Ethernet zamiast natywnej InfiniBand.