기술 가이드

NVLink 및 GPU 상호 연결

NVLink 및 관련 상호 연결은 많은 GPU가 서로 직접적이고 빠르게 통신할 수 있게 해주는 고속 링크입니다.

2분 읽기마지막 업데이트

개요

They are essential because training and serving the largest AI models requires hundreds or thousands of GPUs to act like one giant accelerator.

심층 분석

단일 GPU는 가장 큰 모델을 수용할 수 없으므로 가중치, 기울기 및 활성화와 같은 데이터를 지속적으로 교환해야 하는 여러 칩으로 분할됩니다. 표준 PCIe 버스는 이를 수행하기에는 너무 느리기 때문에 NVIDIA는 훨씬 더 높은 대역폭과 더 낮은 대기 시간을 제공하는 직접 GPU-GPU 링크인 NVLink를 만들었습니다. NVSwitch 칩은 이를 패브릭으로 확장하여 서버의 모든 GPU가 최고 속도로 서로 도달할 수 있도록 하여 8개의 GPU를 하나의 대규모 메모리 및 컴퓨팅 풀로 전환합니다. 랙 규모에서 NVIDIA의 NVL72와 같은 시스템은 통합 NVLink 도메인을 통해 수십 개의 GPU를 연결합니다. 단일 랙을 넘어 InfiniBand 및 이더넷(종종 RDMA 포함)과 같은 네트워킹 기술은 수천 개의 노드를 클러스터에 연결합니다. 이러한 상호 연결의 품질은 모델이 훈련할 수 있는 규모와 속도를 직접적으로 제한합니다.

기술적 통찰력

NVLink는 PCIe보다 몇 배나 낮은 대기 시간의 대역폭을 갖춘 GPU 사이에 전용 지점 간 레인을 제공하여 GPU가 거의 로컬인 것처럼 서로의 메모리를 읽을 수 있도록 합니다. NVSwitch는 고속 크로스바처럼 작동하므로 노드의 모든 GPU가 전체 대역폭에서 비차단 통신을 수행합니다. 훈련 중에 GPU 전체의 기울기를 합산하는 전체 감소와 같은 집단 작업은 이 패브릭에서 훨씬 빠르게 실행됩니다. 이것이 바로 상호 연결 대역폭이 훈련이 여러 칩으로 확장되는 정도에 큰 영향을 미치는 이유입니다.

전략적 영향

비용 및 예산

아키텍처 결정은 수년 동안 성능과 운영 비용을 결정합니다.

더 명확한 결정들

기술 교육은 팀이 최신 스택뿐만 아니라 올바른 스택을 선택하는 데 도움이 됩니다.

품질 관리

더 나은 엔지니어링 선택은 생산 시 신뢰성 사고를 줄입니다.

NVLink 및 GPU 인터커넥트의 미래

모델이 단일 서버보다 커짐에 따라 상호 연결이 시스템이 되고 있습니다. NVLink는 각 세대마다 대역폭을 계속 확보하고 있으며 랙 규모 NVLink 도메인(예: NVL72)은 하나로 작동하는 GPU의 수를 확장하고 있습니다. 더 큰 통합 도메인, 컴퓨팅과 네트워킹의 더 긴밀한 결합, 거리에 따른 전력 절감을 위한 광 링크, 독점 패브릭과 경쟁하기 위한 개방형 상호 연결 표준(예: UALink)을 향한 업계의 노력을 기대합니다. AI 확장은 칩 자체뿐만 아니라 칩 간 데이터 이동에 점점 더 의존하고 있습니다.

실제 구현

NVSwitch를 통해 단일 서버(예: NVIDIA DGX 시스템) 내에서 8개의 GPU를 연결하여 메모리를 공유하고 하나의 대형 모델을 함께 교육합니다.

NVLink 대역폭으로 가속화되는 분산 훈련 중에 GPU 전체에서 전체 감소 경사 동기화를 수행합니다.

랙 규모 NVL72 시스템의 수십 개의 GPU를 1조 매개변수 모델을 위한 하나의 통합 NVLink 도메인으로 연결합니다.

대규모 기반 모델 훈련을 위해 InfiniBand 또는 RDMA-over-Ethernet을 사용하여 수천 대의 GPU 서버를 클러스터에 연결합니다.

위험 및 가드레일

하나의 벤치마크를 최적화하면 더 광범위한 시스템 약점을 숨길 수 있습니다.

인프라 및 유지 관리 비용은 종종 과소평가됩니다.

시스템이 더욱 복잡해짐에 따라 보안 및 관찰 가능성의 격차가 커질 수 있습니다.

구현 로드맵

1

구현하기 전에 지연 시간, 품질, 비용 목표를 정의하세요.

2

현실적인 로드 및 데이터 조건에서 벤치마킹합니다.

3

오류, 드리프트 및 사용자 영향에 대한 계측기 모니터링.

4

확장하기 전에 롤백 및 사고 대응 경로를 준비하세요.

계속 탐색하세요

Free newsletter

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

AI를 위한 GPU와 TPU

자주 묻는 질문

What is NVLink and GPU Interconnects?

NVLink 및 관련 상호 연결은 많은 GPU가 서로 직접적이고 빠르게 통신할 수 있게 해주는 고속 링크입니다. 가장 큰 AI 모델을 훈련하고 제공하려면 하나의 거대한 가속기처럼 작동하려면 수백 또는 수천 개의 GPU가 필요하기 때문에 이는 필수적입니다.

대규모 AI 모델에 NVLink와 같은 고속 상호 연결이 필요한 이유는 무엇입니까?

대형 모델은 단일 GPU의 용량을 초과하므로 가중치, 기울기 및 활성화를 지속적으로 공유하는 많은 칩에 분산되므로 빠른 링크가 필요합니다.

NVLink는 GPU 간 통신을 위해 표준 PCIe 버스에 비해 어떤 이점을 제공합니까?

NVLink는 PCIe보다 훨씬 더 큰 대역폭과 더 낮은 대기 시간을 제공하는 GPU-GPU 직접 링크로, 칩 간 신속한 데이터 교환을 가능하게 합니다.

다중 GPU 서버에서 NVSwitch의 역할은 무엇입니까?

NVSwitch는 NVLink를 비차단 패브릭으로 확장하여 노드의 모든 GPU가 최고 속도로 서로 통신할 수 있도록 합니다.

분산 훈련에서 흔히 사용되는 집단 작업은 빠른 상호 연결로 인해 큰 이점을 얻습니까?

All-Reduce는 각 훈련 단계마다 모든 GPU에서 합계를 구하고 기울기를 공유하므로 속도는 상호 연결 대역폭에 따라 크게 달라집니다.

단일 서버 외에도 일반적으로 수천 개의 GPU 노드를 하나의 클러스터에 연결하는 기술은 무엇입니까?

클러스터 규모에서 InfiniBand 또는 RDMA가 포함된 이더넷과 같은 네트워킹은 많은 노드를 함께 묶어 각 서버 내에서 NVLink를 보완합니다.