คู่มือทางเทคนิค

Gating และการกำหนดเส้นทางในการคำนวณแบบมีเงื่อนไข

การกำหนดเส้นทางและการกำหนดเส้นทางทำให้โครงข่ายประสาทเทียมเปิดใช้งานเฉพาะส่วนที่จำเป็นสำหรับแต่ละอินพุต แทนที่จะเรียกใช้โมเดลทั้งหมดทุกครั้ง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

This decouples model size from compute cost, enabling enormous models that stay fast and cheap to run.

เจาะลึก

การคำนวณแบบมีเงื่อนไขหมายความว่าเครือข่ายจะตัดสินใจโดยขึ้นอยู่กับข้อมูลว่าจะใช้โมดูลย่อยใด เครือข่าย 'gating' หรือ 'เราเตอร์' ที่เรียนรู้ขนาดเล็กจะดูแต่ละอินพุต (มักจะแต่ละตัวโทเค็น) และสร้างคะแนนเพื่อเลือก 'ผู้เชี่ยวชาญ' ที่จะส่งไปให้ ในเลเยอร์ Mixture-of-Experts (MoE) มีเครือข่ายย่อยของผู้เชี่ยวชาญหลายสิบหรือหลายร้อยเครือข่าย แต่เราเตอร์เลือกเฉพาะหนึ่งหรือสองอันดับแรกต่อโทเค็น ดังนั้นผู้เชี่ยวชาญส่วนใหญ่จะไม่ได้ใช้งานสำหรับอินพุตใดๆ ก็ตาม ผลลัพธ์ที่ได้คือโมเดลที่มีการนับพารามิเตอร์รวมจำนวนมากแต่มีจำนวนแอ็คทีฟเพียงเล็กน้อย ทำให้สามารถเป็นตัวแทนของโมเดลขนาดใหญ่โดยมีต้นทุนรันไทม์ที่น้อยกว่ามาก นี่คือวิธีที่โมเดลต่างๆ เช่น Switch Transformer, GLaM และโมเดลภาษาขนาดใหญ่ระดับแนวหน้าอื่นๆ สามารถปรับขนาดพารามิเตอร์ได้ถึงล้านล้านพารามิเตอร์ในราคาประหยัด

ข้อมูลเชิงลึกทางเทคนิค

โดยทั่วไปเราเตอร์จะคำนวณ softmax มากกว่าผู้เชี่ยวชาญ และเลือก top-k จากนั้นรวมเอาต์พุตที่ถ่วงน้ำหนักด้วยคะแนนเกต ความท้าทายคือการปรับสมดุลโหลด: เราเตอร์มักจะชอบผู้เชี่ยวชาญเพียงไม่กี่คน ซึ่งทำให้คนอื่นๆ ไม่ได้รับการฝึกอบรม ดังนั้นการฝึกอบรมจึงเพิ่มการสูญเสียสมดุลโหลดเสริมเพื่อกระจายโทเค็นให้เท่าๆ กัน บวกกับขีดจำกัดความจุที่ทำให้โทเค็นล้นหรือเปลี่ยนเส้นทางใหม่ เนื่องจากการเลือก top-k นั้นแยกจากกันและไม่สามารถแยกแยะได้ การไล่ระดับสีจึงไหลผ่านผู้เชี่ยวชาญที่เลือกและน้ำหนักเกทเท่านั้น

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของ Gating และการกำหนดเส้นทางในการคำนวณแบบมีเงื่อนไข

ขณะนี้เกตติ้งแบบกระจายเป็นศูนย์กลางในการขยายโมเดลชายแดน และแนวโน้มมุ่งไปที่ผู้เชี่ยวชาญที่มีรายละเอียดมากขึ้น เราเตอร์ที่ชาญฉลาดยิ่งขึ้น และการกำหนดเส้นทางในหลายเลเยอร์ คาดหวังเทคนิคที่ดีกว่าสำหรับการฝึกอบรมที่มั่นคง ลดค่าใช้จ่ายในการสื่อสารเมื่อมีผู้เชี่ยวชาญกระจายอยู่ใน Accelerator จำนวนมาก และการวิเคราะห์ 'ความเชี่ยวชาญเฉพาะทางของผู้เชี่ยวชาญ' เพื่อทำความเข้าใจสิ่งที่ผู้เชี่ยวชาญแต่ละคนเรียนรู้ การคำนวณแบบมีเงื่อนไขยังแพร่กระจายไปไกลกว่า MoE ไปสู่เครือข่ายที่ออกก่อนกำหนดและโมเดลเชิงลึกแบบไดนามิกที่ใช้การประมวลผลมากขึ้นเฉพาะกับอินพุตที่ยากกว่าเท่านั้น

การใช้งานจริงในโลกแห่งความเป็นจริง

Switch Transformer กำหนดเส้นทางโทเค็นแต่ละโทเค็นไปยังผู้เชี่ยวชาญเพียงคนเดียว โดยปรับขนาดเป็นพารามิเตอร์มากกว่าล้านล้านพารามิเตอร์ในขณะที่รักษาการประมวลผลต่อโทเค็นให้ต่ำ

โมเดลภาษาขนาดใหญ่แนวชายแดนที่ใช้เลเยอร์ Mixture-of-Experts ดังนั้นจึงเปิดใช้งานน้ำหนักเพียงเศษเสี้ยวต่อโทเค็นเท่านั้น

ตัวแยกประเภทรูปภาพที่ออกก่อนกำหนดซึ่งหยุดที่เลเยอร์ตื้นเพื่อให้รูปภาพง่าย และทำงานลึกยิ่งขึ้นสำหรับรูปภาพที่แข็งเท่านั้น

โมเดลหลายภาษาที่เราเตอร์เรียนรู้ที่จะส่งโทเค็นจากภาษาต่างๆ ไปยังผู้เชี่ยวชาญเฉพาะทางที่แตกต่างกัน

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Gating and Routing in Conditional Computation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การกำหนดเส้นทางการอนุมาน LLM และการปรับสมดุลโหลด

คำถามที่พบบ่อย

What is Gating and Routing in Conditional Computation?

การกำหนดเส้นทางและการกำหนดเส้นทางทำให้โครงข่ายประสาทเทียมเปิดใช้งานเฉพาะส่วนที่จำเป็นสำหรับแต่ละอินพุต แทนที่จะเรียกใช้โมเดลทั้งหมดทุกครั้ง สิ่งนี้จะแยกขนาดโมเดลออกจากต้นทุนการประมวลผล ทำให้โมเดลขนาดใหญ่ที่ทำงานได้อย่างรวดเร็วและราคาถูก

แนวคิดหลักเบื้องหลังการคำนวณแบบมีเงื่อนไขคืออะไร?

การคำนวณแบบมีเงื่อนไขทำให้ตัวเลือกขึ้นอยู่กับข้อมูลว่าโมดูลย่อยใดที่จะรัน ดังนั้นเครือข่ายส่วนใหญ่จึงสามารถอยู่เฉยๆ สำหรับอินพุตใดๆ ก็ตาม

ในเลเยอร์ Mixture-of-Experts เราเตอร์ทำหน้าที่อะไร

เราเตอร์เป็นเครือข่ายการเรียนรู้ขนาดเล็กที่ให้คะแนนผู้เชี่ยวชาญ และส่งโทเค็นแต่ละโทเค็นไปยังผู้เชี่ยวชาญระดับท็อป โดยปล่อยให้ส่วนที่เหลือไม่ได้ใช้สำหรับโทเค็นนั้น

เหตุใดโมเดล MoE จึงมีจำนวนพารามิเตอร์รวมมากแต่มีจำนวนแอคทีฟเพียงเล็กน้อย

เนื่องจากมีการเปิดใช้งานผู้เชี่ยวชาญหนึ่งหรือสองคนต่อโทเค็น การประมวลผลรันไทม์จึงสะท้อนถึงผู้เชี่ยวชาญเหล่านั้นเท่านั้น แม้ว่าโมเดลจะเก็บข้อมูลอื่นๆ อีกมากมายก็ตาม

ที่อยู่การสูญเสียสมดุลโหลดเสริมมีปัญหาอะไร?

เราเตอร์มักจะส่งโทเค็นส่วนใหญ่ไปยังผู้เชี่ยวชาญยอดนิยมเพียงไม่กี่คน การสูญเสียสมดุลโหลดทำให้เกิดการแพร่กระจายที่สม่ำเสมอ ดังนั้นผู้เชี่ยวชาญทุกคนจึงได้รับการฝึกอบรม

เหตุใดการคัดเลือกผู้เชี่ยวชาญระดับ Top-K จึงเป็นความท้าทายสำหรับการฝึกอบรมแบบไล่ระดับ

การเลือกผู้เชี่ยวชาญระดับท็อปเป็นการตัดสินใจที่ยากลำบากและไม่รอบคอบ การไล่ระดับสีสามารถเผยแพร่ผ่านผู้เชี่ยวชาญที่ได้รับการคัดเลือกจริงและน้ำหนักประตูเท่านั้น