คู่มือทางเทคนิค

ความเท่าเทียมของผู้เชี่ยวชาญสำหรับการให้บริการ MoE

การขนานของผู้เชี่ยวชาญจะแยก 'ผู้เชี่ยวชาญ' ที่ส่งต่อฟีดจำนวนมากของโมเดล Mixture-of-Experts ไปยัง GPU ต่างๆ เพื่อให้แต่ละอุปกรณ์เก็บพารามิเตอร์เพียงบางส่วนเท่านั้น

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

นี่คือกุญแจสําคัญในการให้บริการโมเดล MoE ที่มีพารามิเตอร์หลายล้านล้านอย่างประหยัด เพราะมีผู้เชี่ยวชาญเพียงไม่กี่คนที่ทํางานต่อโทเค็น

เจาะลึก

เลเยอร์ Mixture-of-Experts (MoE) จะแทนที่เครือข่ายฟีดฟอร์เวิร์ดขนาดใหญ่หนึ่งเครือข่ายด้วยเครือข่ายย่อย (ผู้เชี่ยวชาญ) จำนวนมาก พร้อมเราเตอร์ที่เลือกผู้เชี่ยวชาญระดับท็อป k (มักจะ 1 หรือ 2) ต่อโทเค็น ความเท่าเทียมของผู้เชี่ยวชาญ (EP) วางผู้เชี่ยวชาญที่แตกต่างกันบน GPU ที่แตกต่างกัน ในการอนุมาน เราเตอร์จะตัดสินใจว่าผู้เชี่ยวชาญแต่ละโทเค็นต้องการ จากนั้นขั้นตอนการสื่อสารแบบ all-to-all จะสับโทเค็นไปยัง GPU ที่ถือผู้เชี่ยวชาญที่พวกเขาเลือกไว้ รัน FFN และสับเปลี่ยนผลลัพธ์กลับ ซึ่งช่วยให้โมเดลมีพารามิเตอร์รวมจำนวนมาก (เบาบาง) ในขณะที่เปิดใช้งานเพียงส่วนเล็กๆ ต่อโทเค็น (FLOP ต่ำ) โมเดลอย่าง Mixtral 8x7B, DeepSeek-V3 และ GPT-OSS ใช้สิ่งนี้ ส่วนที่แข็งคือการปรับสมดุลโหลดระหว่างผู้เชี่ยวชาญและการกระโดดแบบ all-to-all สองรายการต่อเลเยอร์ที่มีค่าใช้จ่ายสูง

ข้อมูลเชิงลึกทางเทคนิค

กลไกหลักคือกลุ่มแบบ all-to-all สองกลุ่มต่อเลเยอร์ MoE: จัดส่ง (ส่งโทเค็นไปยังผู้เชี่ยวชาญ) และรวมกลุ่ม (รวบรวมเอาต์พุตกลับ) เนื่องจากการกำหนดเส้นทางขึ้นอยู่กับข้อมูล จำนวนโทเค็นที่เข้าถึงผู้เชี่ยวชาญแต่ละคนจึงแตกต่างกันไป ทำให้เกิดความไม่สมดุลของโหลดและ 'ผู้หลงทาง' ระบบการให้บริการจะเพิ่มปัจจัยด้านความจุ บัฟเฟอร์ของผู้เชี่ยวชาญ และการลดหรือเพิ่มโทเค็นเพื่อให้ GEMM (การคูณเมทริกซ์) สม่ำเสมอ และมักจะซ้อนทับการสื่อสารแบบ all-to-all ด้วยการคำนวณของผู้เชี่ยวชาญเพื่อซ่อนเวลาแฝง

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของความเท่าเทียมของผู้เชี่ยวชาญสำหรับการให้บริการ MoE

คาดว่าจะมีการออกแบบร่วมกันของการกำหนดเส้นทางและฮาร์ดแวร์ที่เข้มงวดมากขึ้น: รวมเคอร์เนลการจัดส่ง-คำนวณ-รวม, GEMM ที่จัดกลุ่มซึ่งรวบรวมผู้เชี่ยวชาญจำนวนมาก และ NVLink/InfiniBand ที่รับรู้แบบ all-to-all เทคนิคต่างๆ เช่น การปรับสมดุลแบบไม่มีการสูญเสียเสริมของ DeepSeek และการกำหนดเส้นทางแบบจำกัดโหนดจะช่วยลดการรับส่งข้อมูลข้ามโหนด การให้บริการแบบแยกส่วนจะจัดสรร GPU 'ผู้เชี่ยวชาญ' แยกจาก GPU ที่สนใจ และจำนวนผู้เชี่ยวชาญที่มากขึ้น (หลายร้อย) พร้อมด้วย top-k ที่ละเอียดกว่าจะผลักดัน MoE ไปสู่ความกระจัดกระจายอย่างมากในขณะที่รักษาต้นทุนต่อโทเค็นให้คงที่

การใช้งานจริงในโลกแห่งความเป็นจริง

ให้บริการ Mixtral 8x7B บน 2-4 GPU โดยการวางผู้เชี่ยวชาญ 2-4 คนจาก 8 คนในแต่ละอุปกรณ์

DeepSeek-V3 ใช้การกำหนดเส้นทางแบบจำกัดโหนดเพื่อจำกัดจำนวนโหนดที่ผู้เชี่ยวชาญของโทเค็นขยาย และลดระหว่างโหนดแบบทั้งหมดต่อทั้งหมด

การใช้โหมดผู้เชี่ยวชาญคู่ขนาน vLLM หรือ SGLang เพื่อโฮสต์โมเดลแบบกระจาย 200B+ บนโหนด 8-GPU เดียว

การรวมความเท่าเทียมของผู้เชี่ยวชาญเข้ากับความเท่าเทียมของเทนเซอร์บนเลเยอร์ความสนใจในการปรับใช้ EP+TP แบบไฮบริด

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Expert Parallelism for MoE Serving quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การเติมข้อมูลล่วงหน้าแบบแยกส่วนและการแสดงการถอดรหัส

คำถามที่พบบ่อย

Expert Parallelism สําหรับการให้บริการ MoE คืออะไร?

การขนานของผู้เชี่ยวชาญจะแยก 'ผู้เชี่ยวชาญ' ที่ส่งต่อฟีดจำนวนมากของโมเดล Mixture-of-Experts ไปยัง GPU ต่างๆ เพื่อให้แต่ละอุปกรณ์เก็บพารามิเตอร์เพียงบางส่วนเท่านั้น เป็นกุญแจสำคัญในการให้บริการโมเดล MoE พารามิเตอร์ล้านล้านพารามิเตอร์ในราคาถูก เนื่องจากมีผู้เชี่ยวชาญเพียงไม่กี่คนเท่านั้นที่ทำงานต่อโทเค็น

ความเท่าเทียมของผู้เชี่ยวชาญกระจายไปทั่ว GPU อย่างไร

การขนานของผู้เชี่ยวชาญจะวางผู้เชี่ยวชาญที่แตกต่างกัน (เครือข่ายย่อย FFN ของเลเยอร์ MoE) บน GPU ที่แตกต่างกัน ดังนั้นอุปกรณ์แต่ละชิ้นจึงมีเพียงผู้เชี่ยวชาญบางส่วนเท่านั้น

รูปแบบการสื่อสารใดเป็นศูนย์กลางของความเท่าเทียมของผู้เชี่ยวชาญ MoE

โดยทั่วไปแต่ละเลเยอร์ MoE จะต้องมีแบบ all-to-all เพื่อส่งโทเค็นไปยังผู้เชี่ยวชาญ และอีกชั้นหนึ่งแบบ all-to-all เพื่อรวมเอาต์พุตกลับ

เหตุใด MoE จึงรักษาการประมวลผลต่อโทเค็นต่ำแม้จะมีพารามิเตอร์รวมจำนวนมาก

เราเตอร์เปิดใช้งานเฉพาะผู้เชี่ยวชาญระดับ Top-K (มักจะ 1-2) ต่อโทเค็น ดังนั้น FLOP จึงมีขนาดเล็ก แม้ว่าโมเดลดังกล่าวจะมีผู้เชี่ยวชาญจำนวนมากก็ตาม

เกิดปัญหาอะไรขึ้นเนื่องจากการเราต์ขึ้นอยู่กับข้อมูล

เนื่องจากตัวเลือกของเราเตอร์ขึ้นอยู่กับอินพุต ผู้เชี่ยวชาญบางคนจึงได้รับโทเค็นมากกว่าคนอื่นๆ ทำให้เกิดความไม่สมดุลของโหลดและสะดุด

เทคนิคทั่วไปในการทำให้เมทริกซ์ผู้เชี่ยวชาญคูณด้วยขนาดสม่ำเสมอคืออะไร

สแต็คการให้บริการจะกำหนดความจุต่อผู้เชี่ยวชาญ (จำนวนโทเค็นสูงสุด) และแพดหรือวางโทเค็นเกินกว่านั้น เพื่อให้ GEMM ของผู้เชี่ยวชาญแต่ละคนมีรูปร่างที่คาดเดาได้