คู่มือทางเทคนิค

ส่วนผสมของผู้เชี่ยวชาญ LoRA

ส่วนผสมของ LoRA Experts (MoLE) ผสมผสานอะแดปเตอร์ขนาดเล็กจำนวนมากที่ได้รับการฝึกอบรมราคาถูกเข้ากับเราเตอร์ที่เรียนรู้ ดังนั้นโมเดลพื้นฐานเดียวจึงสามารถเชี่ยวชาญงาน สไตล์ หรือทักษะได้อย่างยืดหยุ่น

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it brings the modularity of Mixture-of-Experts to fine-tuning without retraining huge networks.

เจาะลึก

LoRA (การปรับตัวระดับต่ำ) จะหยุดน้ำหนักของโมเดลที่ได้รับการฝึกมาแล้ว และฝึกเมทริกซ์ระดับต่ำเล็กๆ ที่กระตุ้นพฤติกรรมของโมเดล ทำให้การปรับแบบละเอียดมีราคาถูก การผสมผสานของผู้เชี่ยวชาญ LoRA จะฝึกฝนอะแดปเตอร์หลายตัว โดยแต่ละตัวจะจับทักษะ โดเมน หรือแนวคิดภาพที่แตกต่างกัน จากนั้นจึงเพิ่มเครือข่ายเกตขนาดเล็กที่จะตัดสินใจว่าจะเปิดใช้งานอะแดปเตอร์ตัวใด (และแรงแค่ไหน) สำหรับอินพุตที่กำหนด แทนที่จะมีการปรับแต่งแบบละเอียดเพียงครั้งเดียว คุณจะได้รับคลังผู้เชี่ยวชาญที่สามารถเรียบเรียงได้ เราเตอร์สามารถผสมผสานผู้เชี่ยวชาญในแต่ละเลเยอร์และต่อโทเค็น ดังนั้นแบบสอบถามการเขียนโค้ดอาจดึงอะแดปเตอร์ Python ในขณะที่พรอมต์เรื่องราวจะดึงคำบรรยาย วิธีนี้จะหลีกเลี่ยงการรบกวนและหายนะ โดยลืมไปว่าการฝึกฝนอะแดปเตอร์ตัวเดียวในงานผสมหลายๆ งานในคราวเดียว และช่วยให้ทีมเพิ่มหรือลบความเชี่ยวชาญพิเศษโดยไม่ต้องสัมผัสแกนหลักที่ค้างอยู่

ข้อมูลเชิงลึกทางเทคนิค

ผู้เชี่ยวชาญ LoRA แต่ละคนฉีดเดลต้า W = B*A โดยที่ A และ B เป็นเมทริกซ์ระดับต่ำ (อันดับมักจะ 4-64) ฟังก์ชัน gating จะให้น้ำหนักมากกว่าผู้เชี่ยวชาญ และเอาต์พุตจะรวมกันเป็นผลรวมถ่วงน้ำหนัก (การผสมแบบอ่อน) หรือการเลือก top-k (การกำหนดเส้นทางแบบกระจาย) โดยพื้นฐานแล้วตุ้มน้ำหนักพื้นฐานจะยังคงค้างอยู่ ดังนั้นจึงมีการฝึกอบรมเฉพาะอะแดปเตอร์และเราเตอร์เท่านั้น ในโมเดลภาพการแพร่กระจาย เกตติ้งแบบลำดับชั้นจะเรียนรู้น้ำหนักต่อเลเยอร์ ดังนั้น LoRA แนวคิดหลายรายการจึงถูกจัดทำขึ้นโดยไม่ต้องมีแนวคิดใดเหนือกว่าแนวคิดอื่นๆ

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการผสมผสานของผู้เชี่ยวชาญ LoRA

คาดว่าจะมีตลาดอะแดปเตอร์ที่โมเดลโหลดผู้เชี่ยวชาญ LoRA ของชุมชนตามความต้องการ พร้อมด้วยเราเตอร์ที่ค้นพบอัตโนมัติว่าผู้เชี่ยวชาญคนไหนต้องการงานในเวลาอนุมาน การวิจัยกำลังผลักดันไปสู่องค์ประกอบที่เรียนรู้ซึ่งแก้ไขข้อขัดแย้งระหว่างอะแดปเตอร์ การจัดสรรอันดับแบบไดนามิกต่อผู้เชี่ยวชาญ และการรวม MoLE เข้ากับ MoE แบบจำลองพื้นฐานแบบกระจัดกระจายสำหรับความเชี่ยวชาญพิเศษสองระดับ การใช้งานบนอุปกรณ์และ Edge ได้รับประโยชน์สูงสุด เนื่องจากการสลับอะแดปเตอร์ขนาด 2-3 เมกะไบต์มีราคาถูกกว่าการจัดส่งโมเดลเต็มรุ่นใหม่มาก

การใช้งานจริงในโลกแห่งความเป็นจริง

ผู้ช่วยโค้ดที่กำหนดเส้นทางระหว่างผู้เชี่ยวชาญ LoRA ที่แยกกันสำหรับ Python, SQL และ Rust โดยขึ้นอยู่กับไฟล์หรือพรอมต์ เพื่อหลีกเลี่ยงการรบกวนข้ามภาษา

ผู้ใช้ Diffusion ที่เสถียรจะซ้อน LoRA ของตัวละครและสไตล์หลายตัวเข้าด้วยกันด้วยเลเยอร์ gating ดังนั้นภาพบุคคลจึงคงทั้งใบหน้าที่เฉพาะเจาะจงและสไตล์ศิลปะโดยไม่มีสีหรือรายละเอียดที่เด่นชัด

แชทบอตระดับองค์กรกำลังโหลดอะแดปเตอร์สำหรับแต่ละแผนก (กฎหมาย, ทรัพยากรบุคคล, การเงิน) บนโมเดลพื้นฐานแบบแช่แข็งเดียวกัน โดยสลับเข้าด้วยกันโดยไม่ต้องปรับใช้ใหม่

รูปแบบการสนับสนุนหลายภาษาโดยมีผู้เชี่ยวชาญ LoRA หนึ่งคนต่อภาษา กำหนดเส้นทางโดยภาษาอินพุตที่ตรวจพบเพื่อให้ความคล่องของแต่ละภาษาคมชัด

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of LoRA Experts quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การผสมผสานของผู้เชี่ยวชาญ

คำถามที่พบบ่อย

What is Mixture of LoRA Experts?

ส่วนผสมของ LoRA Experts (MoLE) ผสมผสานอะแดปเตอร์ขนาดเล็กจำนวนมากที่ได้รับการฝึกอบรมราคาถูกเข้ากับเราเตอร์ที่เรียนรู้ ดังนั้นโมเดลพื้นฐานเดียวจึงสามารถเชี่ยวชาญงาน สไตล์ หรือทักษะได้อย่างยืดหยุ่น สิ่งสำคัญคือเนื่องจากจะนำความเป็นโมดูลาร์ของผู้เชี่ยวชาญแบบผสมผสานมาปรับแต่งอย่างละเอียดโดยไม่ต้องฝึกอบรมเครือข่ายขนาดใหญ่ใหม่

ส่วน 'LoRA' ของ Mixture of LoRA Experts หมายถึงอะไร

LoRA ย่อมาจาก Low-Rank Adaptation: โดยจะค้างโมเดลพื้นฐานและฝึกเมทริกซ์ระดับต่ำขนาดกะทัดรัดที่ปรับพฤติกรรมได้ในราคาถูก

หน้าที่ของเครือข่าย gating/router ใน MoLE คืออะไร?

เราเตอร์สร้างตุ้มน้ำหนักเหนือผู้เชี่ยวชาญ LoRA ที่มีอยู่ โดยเลือกและผสมน้ำหนักต่ออินพุต (และบ่อยครั้งต่อเลเยอร์หรือโทเค็น)

เหตุใด MoLE จึงดีกว่าการฝึกอบรมอะแดปเตอร์ตัวเดียวในงานผสมหลายอย่าง

ผู้เชี่ยวชาญที่แยกจากกันหลีกเลี่ยงการลืมอันเลวร้ายและการรบกวนงานที่เกิดขึ้นเมื่ออะแดปเตอร์ตัวหนึ่งต้องเรียนรู้ทักษะที่ขัดแย้งกันมากมายในคราวเดียว

ในระหว่างการฝึกแบบ MoLE โดยทั่วไปจะเกิดอะไรขึ้นกับตุ้มน้ำหนักที่ฝึกไว้ล่วงหน้าของโมเดลพื้นฐาน

กระดูกสันหลังยังคงแข็งตัว มีเพียงผู้เชี่ยวชาญ LoRA รายเล็กและเครือข่าย gating เท่านั้นที่ได้รับการอัปเดตการไล่ระดับ

ในโมเดลภาพการแพร่กระจาย เกตติ้งแบบลำดับชั้น/ต่อเลเยอร์ใน MoLE ช่วยแก้ปัญหาอะไรได้บ้าง

การเกทแบบต่อเลเยอร์จะเรียนรู้ว่าอะแดปเตอร์แต่ละตัวมีส่วนช่วยในแต่ละเลเยอร์มากเพียงใด โดยการปล่อยให้ LoRA แนวคิดหลายตัวรวมกันโดยไม่ต้องมีอำนาจเหนือกว่าเพียงตัวเดียว