การเชื่อมต่อระหว่าง NVLink และ GPU
NVLink และการเชื่อมต่อระหว่างกันที่เกี่ยวข้องคือลิงก์ความเร็วสูงที่ช่วยให้ GPU จำนวนมากพูดคุยกันโดยตรงและรวดเร็ว
ภาพรวม
They are essential because training and serving the largest AI models requires hundreds or thousands of GPUs to act like one giant accelerator.
เจาะลึก
GPU ตัวเดียวไม่สามารถรองรับรุ่นที่ใหญ่ที่สุดได้ ดังนั้นจึงถูกแบ่งออกเป็นชิปจำนวนมากที่ต้องแลกเปลี่ยนข้อมูลอย่างต่อเนื่อง เช่น น้ำหนัก การไล่ระดับสี และการเปิดใช้งาน บัส PCIe มาตรฐานช้าเกินไปสำหรับสิ่งนี้ ดังนั้น NVIDIA จึงสร้าง NVLink ซึ่งเป็นลิงก์ระหว่าง GPU กับ GPU โดยตรงที่ให้แบนด์วิธที่สูงกว่ามากและเวลาแฝงที่ต่ำกว่า ชิป NVSwitch ขยายสิ่งนี้ออกเป็นแฟบริคเพื่อให้ GPU ทุกตัวในเซิร์ฟเวอร์สามารถเข้าถึงกันและกันด้วยความเร็วสูงสุด โดยเปลี่ยน GPU แปดตัวให้เป็นหน่วยความจำขนาดใหญ่และกลุ่มการประมวลผลเดียว ในระดับแร็ค ระบบเช่น NVL72 ของ NVIDIA เชื่อมต่อ GPU หลายสิบตัวผ่านโดเมน NVLink ที่รวมเป็นหนึ่งเดียว นอกเหนือจากแร็คเดียว เทคโนโลยีเครือข่ายเช่น InfiniBand และอีเทอร์เน็ต (มักมี RDMA) จะเชื่อมโยงโหนดนับพันรายการไว้ในคลัสเตอร์ คุณภาพของการเชื่อมต่อระหว่างกันเหล่านี้จะจำกัดขนาดและความเร็วของโมเดลในการฝึกโดยตรง
ข้อมูลเชิงลึกทางเทคนิค
NVLink จัดเตรียมเลนแบบจุดต่อจุดโดยเฉพาะระหว่าง GPU ที่มีแบนด์วิธมากกว่า PCIe และเวลาแฝงที่ต่ำกว่า ทำให้ GPU อ่านหน่วยความจำของกันและกันได้เกือบจะเหมือนกับว่าอยู่ในเครื่อง NVSwitch ทำหน้าที่เหมือนคานประตูความเร็วสูง ดังนั้น GPU ทั้งหมดในโหนดจะสื่อสารแบบไม่ปิดกั้นที่แบนด์วิธเต็ม การดำเนินการโดยรวม เช่น all-reduce ซึ่งรวมการไล่ระดับของ GPU ในระหว่างการฝึก จะทำงานเร็วกว่ามากบน Fabric นี้ ซึ่งเป็นเหตุผลว่าทำไมแบนด์วิดท์ที่เชื่อมต่อถึงกันจึงมีอิทธิพลอย่างมากต่อขนาดการฝึกฝนในชิปหลายๆ ตัว
ผลกระทบเชิงกลยุทธ์
ต้นทุนและงบประมาณ
การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี
การตัดสินใจที่ชัดเจนยิ่งขึ้น
การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด
การควบคุมคุณภาพ
ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต
อนาคตของการเชื่อมต่อระหว่าง NVLink และ GPU
เนื่องจากโมเดลมีเซิร์ฟเวอร์มากกว่าเซิร์ฟเวอร์เดียว การเชื่อมต่อถึงกันจึงกลายเป็นระบบ NVLink ได้รับแบนด์วิธอย่างต่อเนื่องในแต่ละรุ่น และโดเมน NVLink ระดับแร็ค (เช่น NVL72) กำลังขยายจำนวน GPU ที่ทำงานเป็นหนึ่งเดียว คาดหวังโดเมนรวมที่ใหญ่กว่า การมีเพศสัมพันธ์ที่แน่นแฟ้นยิ่งขึ้นระหว่างการประมวลผลและเครือข่าย ลิงก์แบบออปติคอลเพื่อลดพลังงานในระยะไกล และความพยายามของอุตสาหกรรมในการสร้างมาตรฐานการเชื่อมต่อระหว่างกันแบบเปิด (เช่น UALink) เพื่อเป็นคู่แข่งกับแฟบริคที่เป็นกรรมสิทธิ์ การปรับขนาด AI ขึ้นอยู่กับการย้ายข้อมูลระหว่างชิปมากขึ้นเรื่อยๆ เช่นเดียวกับบนตัวชิปเอง
การใช้งานจริงในโลกแห่งความเป็นจริง
การเชื่อมต่อ GPU แปดตัวภายในเซิร์ฟเวอร์เดียว (เช่น ระบบ NVIDIA DGX) ผ่าน NVSwitch เพื่อแชร์หน่วยความจำและฝึกฝนโมเดลขนาดใหญ่หนึ่งตัวด้วยกัน
ดำเนินการซิงโครไนซ์การไล่ระดับสีแบบลดทั้งหมดบน GPU ในระหว่างการฝึกแบบกระจาย ซึ่งเร่งความเร็วด้วยแบนด์วิดท์ NVLink
การเชื่อมโยง GPU หลายสิบตัวในระบบ NVL72 ระดับแร็คเข้ากับโดเมน NVLink ที่รวมเป็นหนึ่งเดียวสำหรับโมเดลล้านล้านพารามิเตอร์
เชื่อมโยงเซิร์ฟเวอร์ GPU นับพันตัวเข้ากับคลัสเตอร์โดยใช้ InfiniBand หรือ RDMA-over-Ethernet สำหรับการฝึกฝนโมเดลพื้นฐานขนาดใหญ่
ความเสี่ยงและรั้ว
การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้
ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป
ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น
แผนงานการดำเนินงาน
กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน
เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง
การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้
เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the NVLink and GPU Interconnects quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
GPU กับ TPU สำหรับ AI
คำถามที่พบบ่อย
What is NVLink and GPU Interconnects?
NVLink และการเชื่อมต่อระหว่างกันที่เกี่ยวข้องคือลิงก์ความเร็วสูงที่ช่วยให้ GPU จำนวนมากพูดคุยกันโดยตรงและรวดเร็ว สิ่งเหล่านี้มีความสำคัญเนื่องจากการฝึกฝนและการให้บริการโมเดล AI ที่ใหญ่ที่สุดต้องใช้ GPU นับร้อยหรือหลายพันตัวเพื่อทำหน้าที่เหมือนเครื่องเร่งความเร็วขนาดยักษ์ตัวเดียว
เหตุใดการเชื่อมต่อความเร็วสูงเช่น NVLink จึงจำเป็นสำหรับโมเดล AI ขนาดใหญ่
โมเดลขนาดใหญ่มีความจุเกินความจุของ GPU ตัวเดียว ดังนั้นจึงกระจายไปทั่วชิปจำนวนมากที่แชร์น้ำหนัก การไล่ระดับสี และการเปิดใช้งานอย่างต่อเนื่อง ซึ่งต้องใช้ลิงก์ที่รวดเร็ว
NVLink มีข้อได้เปรียบเหนือบัส PCIe มาตรฐานสำหรับการสื่อสารระหว่าง GPU กับ GPU อย่างไร
NVLink คือการเชื่อมโยง GPU-to-GPU โดยตรงที่มีแบนด์วิดท์ที่สูงกว่าและเวลาแฝงที่ต่ำกว่า PCIe ทำให้สามารถแลกเปลี่ยนข้อมูลระหว่างชิปได้อย่างรวดเร็ว
บทบาทของ NVSwitch ในเซิร์ฟเวอร์หลาย GPU คืออะไร
NVSwitch ขยาย NVLink ไปสู่แฟบริคที่ไม่มีการปิดกั้น ทำให้ GPU ทั้งหมดในโหนดสื่อสารกันด้วยความเร็วสูงสุด
การดำเนินการร่วมกันซึ่งเป็นเรื่องปกติในการฝึกอบรมแบบกระจายใดที่ได้รับประโยชน์อย่างมากจากการเชื่อมต่อระหว่างกันที่รวดเร็ว
ลดผลรวมและแบ่งปันการไล่ระดับสีใน GPU ทั้งหมดในแต่ละขั้นตอนการฝึกฝน ดังนั้นความเร็วจึงขึ้นอยู่กับแบนด์วิดท์ที่เชื่อมต่อถึงกันอย่างมาก
นอกเหนือจากเซิร์ฟเวอร์เดียว เทคโนโลยีใดบ้างที่มักจะเชื่อมต่อโหนด GPU หลายพันโหนดเป็นคลัสเตอร์เดียว
ในระดับคลัสเตอร์ การสร้างเครือข่าย เช่น InfiniBand หรืออีเทอร์เน็ตที่มี RDMA จะเชื่อมโยงโหนดจำนวนมากเข้าด้วยกัน เป็นการเสริม NVLink ภายในแต่ละเซิร์ฟเวอร์