Műszaki ÚTMUTATÓ

NVLink és GPU összeköttetések

Az NVLink és a kapcsolódó összekapcsolások azok a nagy sebességű kapcsolatok, amelyek segítségével sok GPU közvetlenül és gyorsan kommunikálhat egymással.

2 perc olvasásUtoljára frissítve

Áttekintés

They are essential because training and serving the largest AI models requires hundreds or thousands of GPUs to act like one giant accelerator.

Mély merülés

Egyetlen GPU nem képes befogadni a legnagyobb modelleket, ezért azok sok chipre vannak felosztva, amelyeknek folyamatosan adatokat kell cserélniük, például súlyokat, gradienseket és aktiválásokat. A szabványos PCIe busz ehhez túl lassú, ezért az NVIDIA létrehozta az NVLink-et, egy közvetlen GPU-GPU kapcsolatot, amely sokkal nagyobb sávszélességet és alacsonyabb késleltetést kínál. Az NVSwitch chipek ezt egy szövetté terjesztik ki, így a szerver minden GPU-ja teljes sebességgel elérheti a többit, így nyolc GPU-t egyetlen nagy memória- és számítási készletté alakítanak. Rack méretben az olyan rendszerek, mint az NVIDIA NVL72, több tucat GPU-t kapcsolnak össze egy egységes NVLink tartományon keresztül. Az egyetlen állványon túl a hálózati technológiák, mint például az InfiniBand és az Ethernet (gyakran RDMA-val) csomópontok ezreit kötik össze egy fürtben. Ezeknek az összeköttetéseknek a minősége közvetlenül korlátozza, hogy mekkora és milyen gyorsan edzhetnek a modellek.

Technikai betekintés

Az NVLink dedikált pont-pont sávokat biztosít a GPU-k között, a PCIe-nél többszörös sávszélességgel és alacsonyabb késleltetéssel, így a GPU-k szinte úgy olvassák egymás memóriáját, mintha az lokális lenne. Az NVSwitch nagy sebességű keresztlécként működik, így a csomópontban lévő összes GPU nem blokkolva kommunikál teljes sávszélességen. Az olyan kollektív műveletek, mint például az all-reduce, amelyek a GPU-k közötti gradienseket összegzik edzés közben, sokkal gyorsabban futnak ezen a szöveten, ezért az összekapcsolási sávszélesség erősen befolyásolja, hogy a képzés mennyire skálázódik sok chipre.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

Az NVLink és a GPU összekapcsolásának jövője

Ahogy a modellek túlnőnek az egyes szervereken, az összekapcsolás rendszerré válik. Az NVLink generációnként folyamatosan növeli a sávszélességet, és a rack-méretű NVLink tartományok (például az NVL72) növelik az egyként viselkedő GPU-k számát. Nagyobb egységesített tartományokra, a számítási és hálózatépítés szorosabb összekapcsolására, az optikai kapcsolatokra a távolságon keresztüli teljesítmény csökkentésére, valamint az ipari erőfeszítésekre a nyílt összekapcsolási szabványok (például az UALink) felé a rivális szabadalmaztatott szövetekkel szemben. A mesterséges intelligencia skálázása egyre inkább függ a chipek közötti adatmozgatástól, mint maguktól a chipektől.

Valós megvalósítás

Nyolc GPU csatlakoztatása egyetlen szerveren belül (például az NVIDIA DGX rendszerekhez) NVSwitch-en keresztül, így megoszthatják a memóriát, és együtt taníthatnak egy nagy modellt.

Teljesen csökkentett gradiens szinkronizálás végrehajtása a GPU-k között az elosztott betanítás során, az NVLink sávszélességgel felgyorsítva.

Több tucat GPU összekapcsolása egy rack méretű NVL72 rendszerben egyetlen egységes NVLink tartományba billió paraméteres modellek számára.

Több ezer GPU-szerver fürtbe kapcsolása InfiniBand vagy RDMA-over-Ethernet használatával a nagyszabású alapmodell-képzéshez.

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is NVLink and GPU Interconnects?

Az NVLink és a kapcsolódó összekapcsolások azok a nagy sebességű kapcsolatok, amelyek segítségével sok GPU közvetlenül és gyorsan kommunikálhat egymással. Elengedhetetlenek, mert a legnagyobb AI-modellek betanításához és kiszolgálásához több száz vagy több ezer GPU-ra van szükség ahhoz, hogy egyetlen óriási gyorsítóként működjenek.

Miért van szükség a nagy sebességű összekapcsolásokra, mint az NVLink a nagy mesterséges intelligencia modellekhez?

A nagy modellek meghaladják egyetlen GPU kapacitását, így számos chip között vannak elosztva, amelyek folyamatosan megosztják a súlyokat, a gradienseket és az aktiválásokat, ami gyors linkeket igényel.

Milyen előnyt kínál az NVLink a szabványos PCIe-busszal szemben a GPU-GPU kommunikációhoz?

Az NVLink egy közvetlen GPU-GPU kapcsolat, sokkal nagyobb sávszélességgel és alacsonyabb késleltetéssel, mint a PCIe, így gyors adatcserét tesz lehetővé a chipek között.

Mi a szerepe az NVSwitch-nek egy több GPU-s szerverben?

Az NVSwitch kiterjeszti az NVLink-et egy nem blokkoló szövetté, lehetővé téve, hogy a csomópontban lévő összes GPU teljes sebességgel kommunikáljon egymással.

Melyik, az elosztott képzésben elterjedt kollektív működésnek előnyös a gyors összekapcsolás?

Csökkenti az összegeket és osztja meg a gradienseket az összes GPU között minden edzési lépésben, így a sebesség nagymértékben függ az összekapcsolási sávszélességtől.

Egyetlen szerveren kívül milyen technológiák kötnek össze több ezer GPU-csomópontot egy fürtbe?

Fürtléptékben a hálózatok, például az InfiniBand vagy az Ethernet RDMA-val sok csomópontot kötnek össze, kiegészítve az NVLink-et az egyes kiszolgálókon belül.