คู่มือทางเทคนิค

เครือข่าย InfiniBand และ RDMA

InfiniBand คือการเชื่อมต่อความเร็วสูงและเวลาแฝงต่ำที่เชื่อมโยงเซิร์ฟเวอร์และ GPU ในคลัสเตอร์ AI และ RDMA ช่วยให้เครื่องหนึ่งอ่านหรือเขียนหน่วยความจำของอีกเครื่องหนึ่งโดยไม่ต้องเกี่ยวข้องกับ CPU

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.

เจาะลึก

เมื่อคุณฝึกโมเดลกับ GPU หลายพันตัว เครือข่ายมักจะกลายเป็นคอขวด ไม่ใช่ชิป InfiniBand เป็น switched Fabric ที่สร้างขึ้นโดยมีจุดประสงค์เพื่อสิ่งนี้ โดยให้แบนด์วิดท์ต่อลิงก์ในหลายร้อยกิกะบิตต่อวินาที (NDR ทำงานที่ 400 Gb/s) และมีเวลาแฝงระดับไมโครวินาที เคล็ดลับสำคัญคือ Remote Direct Memory Access (RDMA) ซึ่งย้ายข้อมูลโดยตรงระหว่างหน่วยความจำของสองโหนด โดยข้ามเคอร์เนลระบบปฏิบัติการและสำเนา CPU ที่ทำให้ TCP/IP ธรรมดาช้าลง 'การบายพาสเคอร์เนล' นี้จะทำให้วงจร CPU ว่างและลดเวลาแฝง InfiniBand ยังให้การควบคุมโฟลว์ของฮาร์ดแวร์สำหรับแฟบริคที่ไม่สูญเสียคุณภาพ และสวิตช์ Quantum ของ NVIDIA พร้อมอะแดปเตอร์ ConnectX ก็ครองซูเปอร์คอมพิวเตอร์ AI RoCE (RDMA บน Converged Ethernet) นำคุณประโยชน์ RDMA ที่คล้ายคลึงกันมาสู่เครือข่ายอีเทอร์เน็ต

ข้อมูลเชิงลึกทางเทคนิค

RDMA ทำงานผ่านคำกริยาและคู่คิว แอปพลิเคชันโพสต์คำของานเพื่อส่งและรับคิว อะแดปเตอร์เครือข่าย (HCA) จะอ่านและถ่ายโอนข้อมูลโดยตรงไปยังพื้นที่หน่วยความจำที่ลงทะเบียนล่วงหน้าและปักหมุดไว้บนโฮสต์ระยะไกล เนื่องจาก NIC จัดการการถ่ายโอนในฮาร์ดแวร์และเคอร์เนล OS ถูกข้าม จึงมีสำเนาข้อมูลเป็นศูนย์และไม่มีการขัดจังหวะ CPU ต่อแพ็กเก็ตสำหรับการถ่ายโอนจำนวนมาก การควบคุมการไหลตามเครดิตเลเยอร์ลิงก์ของ InfiniBand ป้องกันการล้นของบัฟเฟอร์ ทำให้แฟบริคไม่สูญเสียโดยไม่มีการส่งสัญญาณซ้ำ

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของเครือข่าย InfiniBand และ RDMA

แบนด์วิดท์เพิ่มขึ้นอย่างต่อเนื่อง: XDR InfiniBand ตั้งเป้าไว้ที่ 800 Gb/s ต่อลิงก์ พร้อมแผนการทำงานที่ 1.6 Tb/s การแข่งขันทวีความรุนแรงมากขึ้นเมื่อ Ultra Ethernet Consortium ออกแบบอีเธอร์เน็ตที่ตรงกับ InfiniBand สำหรับปริมาณงาน AI และในขณะที่การประมวลผลในเครือข่าย (SHARP) ถ่ายข้อมูลทางคณิตศาสตร์โดยรวมไปยังสวิตช์เอง คาดว่าจะมีการรวม GPU เข้ากับเครือข่ายที่เข้มงวดยิ่งขึ้น การเชื่อมต่อแบบออปติคอลเพื่อลดพลังงาน และแฟบริคที่ปรับขนาดเป็นกลุ่มตัวเร่งความเร็วหลายแสนตัวเมื่อโมเดลระดับแนวหน้าเติบโตขึ้น

การใช้งานจริงในโลกแห่งความเป็นจริง

การเชื่อมต่อ GPU หลายพันตัวในซูเปอร์คอมพิวเตอร์ AI เพื่อให้ข้อมูลไล่ระดับสีระหว่างโหนดในหน่วยไมโครวินาทีระหว่างการฝึกแบบกระจาย

ปล่อยให้เซิร์ฟเวอร์หนึ่งอ่านหน่วยความจำของอีกเครื่องหนึ่งโดยตรง (RDMA) เพื่อเร่งระบบไฟล์และฐานข้อมูลแบบกระจายโดยไม่มีค่าใช้จ่ายของ CPU

การรัน NCCL แบบลดการดำเนินการทั้งหมดบน InfiniBand เพื่อซิงโครไนซ์น้ำหนักโมเดลทั่วทั้งคลัสเตอร์ GPU

การใช้ RoCE เพื่อนำการถ่ายโอนเวลาแฝงต่ำแบบ RDMA ไปยังเครือข่ายศูนย์ข้อมูลอีเธอร์เน็ตที่มีอยู่

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InfiniBand and RDMA Networking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

ฟีเจอร์ไปป์ไลน์ทางวิศวกรรมและการกำหนดเวอร์ชันข้อมูล

คำถามที่พบบ่อย

What is InfiniBand and RDMA Networking?

InfiniBand คือการเชื่อมต่อความเร็วสูงและเวลาแฝงต่ำที่เชื่อมโยงเซิร์ฟเวอร์และ GPU ในคลัสเตอร์ AI และ RDMA ช่วยให้เครื่องหนึ่งอ่านหรือเขียนหน่วยความจำของอีกเครื่องหนึ่งโดยไม่ต้องเกี่ยวข้องกับ CPU เมื่อรวมเข้าด้วยกันแล้ว สิ่งเหล่านี้คือระบบท่อที่คอยเก็บข้อมูล GPU นับพันตัวระหว่างการฝึกโมเดลขนาดใหญ่

โดยพื้นฐานแล้ว RDMA อนุญาตให้คอมพิวเตอร์เครื่องหนึ่งทำอะไรได้บ้าง

การเข้าถึงหน่วยความจำโดยตรงระยะไกลจะย้ายข้อมูลโดยตรงระหว่างหน่วยความจำของสองโหนด โดยข้ามเคอร์เนลระบบปฏิบัติการและสำเนาของ CPU ซึ่งจะลดเวลาแฝงและลดรอบของ CPU

เหตุใด InfiniBand จึงมีความหน่วงต่ำกว่าเครือข่าย TCP/IP ทั่วไปมาก

อะแดปเตอร์ InfiniBand ถ่ายโอนข้อมูลโดยตรงไปยัง/จากหน่วยความจำที่ปักหมุดไว้ในฮาร์ดแวร์ และบายพาสเคอร์เนล OS ซึ่งช่วยลดการขัดจังหวะ CPU ต่อแพ็กเก็ตและการคัดลอกข้อมูล

NDR InfiniBand ให้แบนด์วิธต่อลิงก์โดยประมาณเท่าใด

NDR (อัตราข้อมูลถัดไป) InfiniBand ทำงานที่ 400 Gb/s ต่อลิงก์ โดย XDR ตั้งเป้าหมายที่ 800 Gb/s ในรุ่นถัดไป

ใน RDMA 'คู่คิว' ใช้เพื่ออะไร

แอปพลิเคชันโพสต์คำขอทำงานเพื่อส่งและรับคิว (คู่คิว) อะแดปเตอร์ช่องโฮสต์จะอ่านและดำเนินการถ่ายโอนหน่วยความจำโดยตรง

RoCE คืออะไร?

RoCE ย่อมาจาก RDMA ผ่าน Converged Ethernet ซึ่งให้เวลาแฝงต่ำ การถ่ายโอนเคอร์เนลบายพาสบนอีเธอร์เน็ตแฟบริคมาตรฐาน แทนที่จะเป็น InfiniBand ดั้งเดิม