การผสมผสานของผู้เชี่ยวชาญ
Mixture of Experts (MoE) คือการออกแบบโมเดลที่แบ่งเครือข่ายออกเป็นเครือข่ายย่อยเฉพาะจำนวนมาก และเปิดใช้งานเพียงไม่กี่รายการต่ออินพุต
ภาพรวม
It lets models hold enormous knowledge while keeping each prediction fast and cheap.
เจาะลึก
หม้อแปลงมาตรฐานจะรันทุกอินพุตผ่านเลเยอร์ที่มีความหนาแน่นเท่ากัน ดังนั้นการทำให้โมเดลชาญฉลาดขึ้นมักจะหมายถึงการทำให้ทุกการคำนวณมีราคาแพงขึ้น การผสมผสานของผู้เชี่ยวชาญทำลายลิงก์นั้น โดยจะแทนที่เลเยอร์ฟีดไปข้างหน้าขนาดใหญ่ด้วยเครือข่าย 'ผู้เชี่ยวชาญ' ขนาดเล็กจำนวนมาก รวมถึง 'เราเตอร์' ขนาดเล็กที่จะตัดสินใจว่าผู้เชี่ยวชาญคนใดจัดการแต่ละโทเค็น โดยปกติแล้วจะมีเพียงผู้เชี่ยวชาญ 1 หรือ 2 อันดับแรกเท่านั้นที่เริ่มทำงาน ดังนั้นโมเดลจึงสามารถมีพารามิเตอร์ทั้งหมดได้หลายแสนล้านรายการ แต่เปิดใช้งานเพียงเศษส่วนเล็กน้อยต่อโทเค็นเท่านั้น นี่คือสาเหตุที่โมเดลอย่าง Mixtral 8x7B และสถาปัตยกรรมที่ลือกันว่าอยู่เบื้องหลัง GPT-4 เข้าถึงคุณภาพสูงโดยไม่ต้องเสียค่าใช้จ่ายในการอนุมานที่สูงตามสัดส่วน ข้อเสียเปรียบนั้นมีความซับซ้อน: ผู้เชี่ยวชาญทุกคนยังต้องพอดีกับหน่วยความจำ และเราเตอร์สามารถกำหนดเส้นทางผิดหรือโอเวอร์โหลดผู้เชี่ยวชาญบางคนได้ ดังนั้นการฝึกอบรมจึงต้องมีความสมดุลอย่างระมัดระวัง
ข้อมูลเชิงลึกทางเทคนิค
หัวใจของ MoE คือเครือข่าย gating ซึ่งเป็นเลเยอร์การเรียนรู้เล็กๆ ที่จะให้คะแนนผู้เชี่ยวชาญแต่ละคนสำหรับโทเค็นที่เข้ามา และกำหนดเส้นทางโทเค็นไปยังผู้ทำคะแนนสูงสุดในระดับ top-k (มักจะเป็น k=1 หรือ 2) หากต้องการหยุดไม่ให้เราเตอร์ส่งทุกอย่างให้กับผู้เชี่ยวชาญคนโปรด การฝึกอบรมจะเพิ่ม 'การสูญเสียสมดุลโหลด' เสริมซึ่งจะลงโทษการใช้งานที่ไม่สม่ำเสมอ เนื่องจากมีเพียงผู้เชี่ยวชาญ k คนเท่านั้นที่ทำงานต่อโทเค็น การคำนวณ (FLOP) จะยังคงคงที่แม้ว่าคุณจะเพิ่มผู้เชี่ยวชาญมากขึ้น ดังนั้นพารามิเตอร์ทั้งหมดและระดับต้นทุนต่อโทเค็นจึงแยกจากกัน
ผลกระทบเชิงกลยุทธ์
ต้นทุนและงบประมาณ
การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี
การตัดสินใจที่ชัดเจนยิ่งขึ้น
การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด
การควบคุมคุณภาพ
ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต
อนาคตของการผสมผสานของผู้เชี่ยวชาญ
MoE กำลังกลายเป็นเครื่องมือเริ่มต้นสำหรับโมเดลระดับแนวหน้า เนื่องจากมีการแยกความจุออกจากต้นทุน คาดหวังผู้เชี่ยวชาญที่ละเอียดยิ่งขึ้น การกำหนดเส้นทางที่ชาญฉลาดยิ่งขึ้นโดยพิจารณาบริบทมากขึ้น และเทคนิคที่ดีกว่าในการให้บริการโมเดลขนาดใหญ่ที่กระจัดกระจายบนฮาร์ดแวร์ที่มีข้อจำกัด การวิจัยยังจัดการกับปัญหาหน่วยความจำ เนื่องจากผู้เชี่ยวชาญทุกคนจะต้องได้รับการโหลดแม้ว่าจะมีการดำเนินการเพียงไม่กี่ครั้งก็ตาม ผ่านการถ่ายข้อมูลและการหาปริมาณของผู้เชี่ยวชาญ เมื่อโมเดลเปิดอย่าง Mixtral และ DeepSeek-MoE เติบโตเต็มที่ สถาปัตยกรรมแบบเบาบางก็น่าจะขับเคลื่อนผู้ช่วยที่มีประสิทธิภาพมากขึ้นด้วยงบประมาณ GPU ที่น้อยกว่า
การใช้งานจริงในโลกแห่งความเป็นจริง
Mixtral 8x7B ใช้ผู้เชี่ยวชาญ 8 คนและเปิดใช้งาน 2 รายการต่อโทเค็น โดยให้พารามิเตอร์รวมประมาณ 47B แต่ใช้งานเพียง ~13B ต่อโทเค็นเพื่อการอนุมานที่รวดเร็วและถูกกว่า
DeepSeek และ Qwen จัดส่งโมเดลภาษา MoE ขนาดใหญ่ที่จับคู่โมเดลหนาแน่นบนการวัดประสิทธิภาพ ในขณะที่ทำงานด้วยการประมวลผลต่อโทเค็นที่ต่ำกว่า
ผู้ให้บริการ Cloud LLM ใช้ MoE ดังนั้นโมเดลขนาดใหญ่เพียงตัวเดียวจึงสามารถให้บริการผู้ใช้จำนวนมากได้ในราคาประหยัด เนื่องจากแต่ละคำขอจะส่องสว่างเฉพาะผู้เชี่ยวชาญเพียงไม่กี่คนเท่านั้น
Switch Transformer รุ่นก่อนหน้าของ Google ปรับขนาดให้มีพารามิเตอร์มากกว่าล้านล้านพารามิเตอร์โดยใช้การกำหนดเส้นทางระดับบนสุดเพื่อให้สามารถจัดการการประมวลผลการฝึกอบรมได้
ความเสี่ยงและรั้ว
การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้
ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป
ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น
แผนงานการดำเนินงาน
กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน
เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง
การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้
เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixture of Experts quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
ส่วนผสมของผู้เชี่ยวชาญ LoRA
คำถามที่พบบ่อย
What is Mixture of Experts?
Mixture of Experts (MoE) คือการออกแบบโมเดลที่แบ่งเครือข่ายออกเป็นเครือข่ายย่อยเฉพาะจำนวนมาก และเปิดใช้งานเพียงไม่กี่รายการต่ออินพุต ช่วยให้โมเดลเก็บความรู้จำนวนมหาศาลในขณะเดียวกันก็ทำให้การคาดการณ์แต่ละครั้งรวดเร็วและประหยัด
ในเลเยอร์ Mixture of Experts อะไรเป็นตัวตัดสินว่าผู้เชี่ยวชาญคนใดประมวลผลโทเค็นที่กำหนด
A small gating network learns to score each expert for the token and routes it to the top-scoring ones. เรียนรู้การกำหนดเส้นทาง ไม่คงที่หรือสุ่ม
เหตุใดโมเดล MoE จึงมีพารามิเตอร์รวมมากกว่าโมเดลหนาแน่นโดยไม่มีการเพิ่มต้นทุนต่อโทเค็นให้ตรงกัน
เนื่องจากมีเพียงผู้เชี่ยวชาญระดับท็อปเท่านั้นที่ทำงานต่อโทเค็น การประมวลผลที่ใช้งานอยู่จึงคงที่โดยประมาณ แม้ว่าจำนวนพารามิเตอร์ทั้งหมดจะเพิ่มขึ้นโดยการเพิ่มผู้เชี่ยวชาญมากขึ้น
ที่อยู่การสูญเสียสมดุลโหลด (เสริม) ในระหว่างการฝึกอบรม MoE มีปัญหาอะไร
เราเตอร์มีแนวโน้มที่จะชื่นชอบผู้เชี่ยวชาญจำนวนหนึ่งโดยไม่สมดุล การสูญเสียเสริมจะลงโทษการใช้งานที่ไม่สม่ำเสมอ ดังนั้นผู้เชี่ยวชาญทุกคนจึงได้รับการฝึกอบรม
Mixtral 8x7B เปิดใช้งานผู้เชี่ยวชาญ 2 คนจาก 8 คนต่อโทเค็น สิ่งนี้มีความหมายอย่างไรเกี่ยวกับการประมวลผลเทียบกับขนาดของมัน?
เนื่องจากผู้เชี่ยวชาญเพียง 2 ใน 8 คนใช้งานอยู่ พารามิเตอร์ที่ใช้งานอยู่ต่อโทเค็น (~13B) จึงน้อยกว่ายอดรวม ~47B มาก ซึ่งช่วยลดต้นทุนการอนุมานได้
ข้อใดคือข้อเสียที่แท้จริงของรุ่น MoE เมื่อเทียบกับรุ่นที่มีความหนาแน่นเท่ากัน
แม้ว่าจะมีผู้เชี่ยวชาญเพียงไม่กี่คนเท่านั้นที่คำนวณต่อโทเค็น น้ำหนักของผู้เชี่ยวชาญทุกคนจะต้องถูกโหลดในหน่วยความจำ ทำให้โมเดล MoE ต้องใช้หน่วยความจำในการให้บริการ