คู่มือ AI ภาษา

ส่วนผสมของความลึก

Mixture of Depths (MoD) ช่วยให้หม้อแปลงใช้การประมวลผลในปริมาณที่แตกต่างกันบนโทเค็นที่แตกต่างกัน โดยกำหนดเส้นทางเฉพาะโทเค็นที่ 'สำคัญ' ผ่านการคำนวณจำนวนมากของแต่ละเลเยอร์

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It cuts the cost of processing easy tokens while keeping a fixed, predictable compute budget.

เจาะลึก

หม้อแปลงมาตรฐานใช้ทุกเลเยอร์กับทุกโทเค็น แม้แต่อันเล็กๆ น้อยๆ เช่นเครื่องหมายวรรคตอน Mixture of Depths เปิดตัวโดย Google DeepMind ในปี 2024 เพิ่มเราเตอร์ขนาดเล็กในแต่ละบล็อกที่เลือกเศษส่วน top-k คงที่ของโทเค็นเพื่อรับการดูแลตนเองเต็มรูปแบบและการคำนวณ MLP ส่วนที่เหลือจะข้ามบล็อกผ่านการเชื่อมต่อที่เหลือ เนื่องจากมีการประมวลผลโทเค็น k เท่านั้นต่อเลเยอร์ การประมวลผลทั้งหมด (FLOP) จึงถูกจำกัดและทราบล่วงหน้า ซึ่งแตกต่างจากวิธีไดนามิกเชิงลึกก่อนหน้านี้ซึ่งแปรผันอย่างคาดเดาไม่ได้ ทำให้การใช้แบตช์และฮาร์ดแวร์มีประสิทธิภาพ โมเดลที่ได้รับการฝึกอบรมจาก MoD สามารถจับคู่คุณภาพของหม้อแปลงพื้นฐานได้โดยใช้ FLOP น้อยลงต่อการส่งต่อ หรือเข้าถึงคุณภาพที่สูงขึ้นในการประมวลผลเดียวกัน และแนวคิดนี้ประกอบขึ้นอย่างเป็นธรรมชาติด้วย Mixture-of-Experts เพื่อให้โมเดล 'MoDE' กำหนดเส้นทางทั้งในด้านความลึกและความกว้าง

ข้อมูลเชิงลึกทางเทคนิค

ในแต่ละบล็อก MoD เราเตอร์เชิงเส้นที่เรียนรู้จะให้คะแนนทุกโทเค็นและเก็บคะแนนสูงสุดไว้ตามคะแนน โทเค็นที่เลือกส่งผ่านความสนใจและ MLP ในขณะที่โทเค็นที่ไม่ได้เลือกจะถูกยกยอดไปข้างหน้าโดยไม่มีการเปลี่ยนแปลงตามเส้นทางที่เหลือ การใช้ top-k แบบคงที่ (แทนที่จะเป็นเกณฑ์ต่อโทเค็น) ทำให้กราฟการคำนวณคงที่และรูปร่างเทนเซอร์คงที่ ซึ่งเป็นมิตรกับฮาร์ดแวร์ เราเตอร์ได้รับการฝึกฝนกับส่วนที่เหลือของเครือข่าย และการสร้างเชิงสาเหตุใช้ตัวทำนายเสริม ดังนั้นการตัดสินใจกำหนดเส้นทางจึงไม่ดูโทเค็นในอนาคต

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการผสมผสานความลึก

การคำนวณแบบมีเงื่อนไขเป็นกลไกสำคัญในการเพิ่มประสิทธิภาพตามขนาดโมเดล และ MoD เป็นตัวอย่างแรกเริ่มที่สะอาดตา คาดหวังการผสานรวมที่ลึกซึ้งยิ่งขึ้นกับ Mixture-of-Experts (การกำหนดเส้นทางทั้งเชิงลึกและผู้เชี่ยวชาญ) งบประมาณที่ปรับเปลี่ยนได้ซึ่งลดลงเพื่อให้ป้อนข้อมูลได้ง่าย และเราเตอร์ที่เรียนรู้ที่จะระบุได้ดีขึ้นว่าโทเค็นใดที่ต้องการการประมวลผลเชิงลึกอย่างแท้จริง เนื่องจากต้นทุนการอนุมานมีอิทธิพลเหนือเศรษฐศาสตร์การปรับใช้ เทคนิคที่ทำให้โมเดล 'คิดหนักขึ้น' เฉพาะเมื่อจำเป็นเท่านั้น ขณะเดียวกันก็รักษาเวลาแฝงที่คาดการณ์ได้ จึงมีแนวโน้มที่จะกลายเป็นมาตรฐานในสถาปัตยกรรมขนาดใหญ่

การใช้งานจริงในโลกแห่งความเป็นจริง

การลด FLOP ที่จำเป็นในการประมวลผลเอกสารขนาดยาวโดยการข้ามการคำนวณเชิงลึกเกี่ยวกับโทเค็นตัวเติม

การฝึกอบรมโมเดลที่ตรงกับคุณภาพพื้นฐานด้วยการประมวลผลที่ต่ำกว่า ซึ่งช่วยลดต้นทุนการให้บริการ

ผสมผสานกับ Mixture-of-Experts (MoDE) เพื่อกำหนดเส้นทางทั้งความลึกของเลเยอร์และตัวเลือกของผู้เชี่ยวชาญ

รักษาเวลาแฝงคงที่ต่อโทเค็นที่คาดการณ์ได้ เนื่องจากงบประมาณการประมวลผลต่อเลเยอร์ได้รับการแก้ไขล่วงหน้า

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Depths quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การรวมตัวของสารผสม

คำถามที่พบบ่อย

What is Mixture of Depths?

Mixture of Depths (MoD) ช่วยให้หม้อแปลงใช้การประมวลผลในปริมาณที่แตกต่างกันบนโทเค็นที่แตกต่างกัน โดยกำหนดเส้นทางเฉพาะโทเค็นที่ 'สำคัญ' ผ่านการคำนวณจำนวนมากของแต่ละเลเยอร์ ช่วยลดต้นทุนในการประมวลผลโทเค็นอย่างง่าย ในขณะเดียวกันก็รักษางบประมาณการประมวลผลที่คงที่และคาดการณ์ได้

Mixture of Depths แตกต่างกันไปตามโทเค็นอย่างไร

MoD กำหนดเส้นทางโทเค็นบางส่วนเท่านั้นผ่านการคำนวณจำนวนมากของแต่ละเลเยอร์ ดังนั้นโทเค็นที่ต่างกันจึงมีความลึกที่แตกต่างกันอย่างมีประสิทธิภาพ

MoD จะรักษางบประมาณการประมวลผลให้คาดการณ์ได้อย่างไร

การเลือก top-k คงที่ของโทเค็นต่อบล็อกแคป FLOP และรักษารูปร่างเทนเซอร์ให้คงที่ ซึ่งเป็นมิตรกับฮาร์ดแวร์

จะเกิดอะไรขึ้นกับโทเค็นที่เราเตอร์ไม่ได้เลือกที่บล็อกที่กำหนด

โทเค็นที่ไม่ได้เลือกจะข้ามการคำนวณของบล็อกและถูกยกยอดไปข้างหน้าโดยไม่มีการเปลี่ยนแปลงโดยเส้นทางที่เหลือ

ใครเป็นคนแนะนำ Mixture of Depths?

Mixture of Depths ได้รับการแนะนำโดย Google DeepMind ในรายงานปี 2024 เกี่ยวกับการประมวลผลหม้อแปลงแบบไดนามิก

การรวม MoD เข้ากับ Mixture-of-Experts ก่อให้เกิดอะไร?

การรวมการกำหนดเส้นทางเชิงลึกเข้ากับการกำหนดเส้นทางโดยผู้เชี่ยวชาญทำให้ได้โมเดล 'MoDE' ที่มีเงื่อนไขในการประมวลผลทั้งบนเลเยอร์และผู้เชี่ยวชาญ