คู่มือทางเทคนิค

โมเดล Mixtral และ Sparse

Mixtral เป็นโมเดลแบบผสมผสานของผู้เชี่ยวชาญแบบเปิดของ Mistral AI ที่ให้คุณภาพของโมเดลขนาดใหญ่ด้วยความเร็วของโมเดลขนาดเล็ก

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

โมเดลแบบเบาบางเหมือนกับที่เปิดใช้งานเพียงเศษเสี้ยวของพารามิเตอร์ต่อโทเค็น ช่วยลดการประมวลผลโดยไม่ทำให้ความสามารถลดลง

เจาะลึก

Mixtral 8x7B ซึ่งเปิดตัวโดย Mistral AI ในช่วงปลายปี 2023 ทำให้แนวทางการผสมผสานของผู้เชี่ยวชาญ (MoE) แบบเบาบางเป็นที่นิยมในรุ่นเปิด ประกอบด้วยเครือข่ายฟีดฟอร์เวิร์ด 'ผู้เชี่ยวชาญ' แยกกันแปดเครือข่ายต่อเลเยอร์ โดยมีพารามิเตอร์ทั้งหมดประมาณ 47 พันล้านพารามิเตอร์ แต่เราเตอร์น้ำหนักเบาจะเลือกผู้เชี่ยวชาญเพียงสองคนสำหรับแต่ละโทเค็น ด้วยเหตุนี้ จึงมีพารามิเตอร์ที่ใช้งานอยู่ประมาณ 13 พันล้านพารามิเตอร์ต่อโทเค็น ดังนั้นการอนุมานจึงดำเนินการได้เร็วพอๆ กับโมเดลหนาแน่น 13B ในขณะที่มีคุณภาพเทียบเท่ากับโมเดลที่ใหญ่กว่ามาก Mixtral จับคู่หรือเอาชนะ GPT-3.5 และ Llama 2 70B ในเกณฑ์มาตรฐานต่างๆ ในขณะที่ให้บริการได้เร็วกว่าและราคาถูกกว่า มิสทรัลเปิดตัว Mixtral 8x22B ในเวลาต่อมา โมเดลดังกล่าวได้รับอนุญาตอย่างเปิดเผยภายใต้ Apache 2.0 ซึ่งกระตุ้นให้เกิดการนำไปใช้อย่างรวดเร็วและการปรับแต่งอย่างละเอียดในชุมชนโอเพ่นซอร์ส

ข้อมูลเชิงลึกทางเทคนิค

ในเลเยอร์ MoE แบบกระจัดกระจาย บล็อกฟีดฟอร์เวิร์ดหนาแน่นจะถูกแทนที่ด้วยเครือข่ายผู้เชี่ยวชาญ N บวกกับเครือข่ายเกตขนาดเล็ก (เราเตอร์) สำหรับแต่ละโทเค็น เราเตอร์จะคำนวณคะแนนและเลือกผู้เชี่ยวชาญระดับท็อป (2 อันดับแรกใน Mixtral) โดยกำหนดเส้นทางโทเค็นผ่านสิ่งเหล่านั้นเท่านั้น ผลลัพธ์จะถูกถ่วงน้ำหนักและสรุป เนื่องจากผู้เชี่ยวชาญส่วนใหญ่ไม่มีการใช้งานต่อโทเค็น โมเดลจึงเก็บพารามิเตอร์จำนวนมากไว้ในหน่วยความจำแต่ยังใช้การคำนวณน้อยกว่ามาก ข้อดีข้อเสีย: ผู้เชี่ยวชาญทุกคนจะต้องโหลดลงใน VRAM แม้ว่าจะใช้งานเพียงบางส่วนเท่านั้น

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของโมเดล Mixtral และ Sparse

ตอนนี้ Sparse MoE เป็นศูนย์กลางของ AI ระดับแนวหน้าแล้ว คาดว่าจะมีการเปิดตัว MoE ที่เปิดกว้างมากขึ้น การกำหนดเส้นทางที่ละเอียดยิ่งขึ้นกับผู้เชี่ยวชาญรายย่อยจำนวนมาก และการออกแบบของผู้เชี่ยวชาญที่ใช้ร่วมกันหรือไฮบริดที่ปรับปรุงประสิทธิภาพให้ดียิ่งขึ้น เมื่อโมเดลขยายไปสู่พารามิเตอร์ทั้งหมดนับล้านล้าน ความกระจัดกระจายจึงเป็นปัจจัยหลักในการทำให้การอนุมานมีราคาไม่แพง การวิจัยกำลังจัดการกับจุดอ่อนของ MoE การปรับสมดุลโหลดของผู้เชี่ยวชาญ โอเวอร์เฮดของหน่วยความจำ และความเสถียรในการฝึกอบรม ในขณะที่ฮาร์ดแวร์และสแต็กการให้บริการได้รับการปรับปรุงให้เหมาะสมมากขึ้นโดยเฉพาะสำหรับการกำหนดเส้นทางของผู้เชี่ยวชาญ

การใช้งานจริงในโลกแห่งความเป็นจริง

ให้บริการแชทบอทคุณภาพสูงในราคาและความเร็วเท่ากับโมเดลที่มีความหนาแน่นน้อยกว่ามาก

โฮสต์ด้วยตนเองในโมเดลลิขสิทธิ์ Apache-2.0 สำหรับผลิตภัณฑ์เชิงพาณิชย์โดยไม่มีค่าธรรมเนียมการใช้งาน

ปรับแต่งพฤติกรรมแต่ละอย่างอย่างละเอียดบน Mixtral สำหรับการเขียนโค้ด การสรุป หรืองานหลายภาษา

เรียกใช้การอนุมานอย่างรวดเร็วบนเซิร์ฟเวอร์หลาย GPU ตัวเดียว โดยที่โมเดล 70B หนาแน่นจะช้าเกินไป

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

โมเดลและความเท่าเทียมของท่อ

คำถามที่พบบ่อย

Mixtral และ Sparse Models คืออะไร?

Mixtral เป็นโมเดลแบบผสมผสานของผู้เชี่ยวชาญแบบเปิดของ Mistral AI ที่ให้คุณภาพของโมเดลขนาดใหญ่ด้วยความเร็วของโมเดลขนาดเล็ก โมเดลแบบเบาบางเหมือนกับที่เปิดใช้งานเพียงเศษเสี้ยวของพารามิเตอร์ต่อโทเค็น ช่วยลดการประมวลผลโดยไม่ทำให้ความสามารถลดลง

ใน Mixtral 8x7B มีผู้เชี่ยวชาญกี่คนที่ประมวลผลโทเค็นแต่ละรายการ

Mixtral ใช้การกำหนดเส้นทางบนสุด 2: ​​เราเตอร์เลือกผู้เชี่ยวชาญสองในแปดคนเพื่อประมวลผลแต่ละโทเค็น

องค์ประกอบใดเป็นตัวตัดสินว่าโทเค็นจะถูกส่งไปให้ผู้เชี่ยวชาญคนใด

เครือข่ายเกตติ้งขนาดเล็กที่เรียกว่าเราเตอร์ จะให้คะแนนผู้เชี่ยวชาญและเลือกว่าเครือข่ายใดจะจัดการโทเค็นแต่ละรายการ

แม้ว่า Mixtral 8x7B จะมีพารามิเตอร์ทั้งหมดประมาณ 47B แต่ประมาณว่ามีกี่พารามิเตอร์ที่ใช้งานอยู่ต่อโทเค็น

เนื่องจากมีผู้เชี่ยวชาญเพียงสองคนที่ทำงานต่อโทเค็น จึงมีพารามิเตอร์ที่ใช้งานอยู่ประมาณ 13 พันล้านพารามิเตอร์ ทำให้มีความเร็วเท่ากับรุ่นที่เล็กกว่ามาก

อะไรคือข้อแลกเปลี่ยนที่สำคัญของโมเดล MoE แบบกระจัดกระจายอย่าง Mixtral?

MoE บันทึกการประมวลผลต่อโทเค็น แต่ยังต้องการให้ผู้เชี่ยวชาญทุกคนอยู่ใน VRAM ทำให้มีความต้องการหน่วยความจำเพิ่มขึ้น

Mistral AI เผยแพร่ Mixtral ภายใต้ใบอนุญาตใด ซึ่งกระตุ้นให้เกิดการยอมรับแบบเปิด

Mixtral ได้รับการเผยแพร่ภายใต้ลิขสิทธิ์ Apache 2.0 ที่อนุญาต อนุญาตให้นำไปใช้ในเชิงพาณิชย์ได้ฟรีและปรับแต่งอย่างละเอียด