คู่มือทางเทคนิค

การรวมโมเดล

การรวมโมเดลจะรวมน้ำหนักของโครงข่ายประสาทเทียมที่ได้รับการฝึกตั้งแต่สองตัวขึ้นไปให้เป็นโมเดลเดียว โดยไม่ต้องมีการฝึกซ้ำหรือเข้าถึงข้อมูลการฝึกดั้งเดิมใดๆ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it lets teams blend specialized skills cheaply, turning expensive fine-tuned models into reusable building blocks.

เจาะลึก

การรวมโมเดลจะรวมพารามิเตอร์จริง (น้ำหนัก) ของโมเดลหลายตัวที่ใช้สถาปัตยกรรมเดียวกัน วิธีที่ง่ายที่สุดคือการหาค่าเฉลี่ยน้ำหนักโดยใช้ค่าเฉลี่ยของน้ำหนักที่สอดคล้องกัน วิธีการที่ชาญฉลาดกว่านั้นใช้ได้กับ 'เวกเตอร์งาน' ซึ่งเป็นความแตกต่างระหว่างแบบจำลองที่ได้รับการปรับแต่งและฐานของมัน การเพิ่มเวกเตอร์งานเป็นการแทรกทักษะ การลบออกสามารถลบพฤติกรรมที่ไม่พึงประสงค์ได้ เทคนิคเช่น TIES-Merging และ DARE ตัดแต่งและปรับขนาดเวกเตอร์เหล่านี้เพื่อลดการรบกวนเมื่อหลาย ๆ โมเดลรวมกัน เนื่องจากไม่จำเป็นต้องมีการไล่ระดับหรือข้อมูล การผสานจึงดำเนินการในไม่กี่วินาทีบนแล็ปท็อป สิ่งที่จับได้: ใช้งานได้เฉพาะเมื่อโมเดลลงมาจากฐานร่วมและอาศัยอยู่ในพื้นที่ที่เข้ากันได้ของพื้นที่น้ำหนัก

ข้อมูลเชิงลึกทางเทคนิค

แนวคิดหลักคือการปรับแต่งอย่างละเอียดจะย้ายตุ้มน้ำหนักไปตาม 'จุดสูญเสีย' ที่ค่อนข้างราบเรียบใกล้กับโมเดลพื้นฐาน เวกเตอร์งานเป็นเพียง (น้ำหนักที่ปรับแล้วลบด้วยน้ำหนักฐาน) เนื่องจากเวกเตอร์เหล่านี้เป็นเส้นตรงโดยประมาณและมักจะอยู่ใกล้มุมฉากในงานต่างๆ คุณจึงสามารถรวมหลายๆ เข้าด้วยกันได้ และแบบจำลองที่รวมกันจะรักษาทักษะแต่ละอย่างไว้ ก่อนอื่น TIES และ DARE จะตัดเดลต้าน้ำหนักขนาดเล็กหรือที่ขัดแย้งกันออกก่อน เพื่อลดความขัดแย้งในการลงนาม จากนั้นจึงรวมเข้าด้วยกัน เพื่อป้องกันไม่ให้งานหนึ่งเขียนทับงานอื่น

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการผสานโมเดล

คาดว่าการรวมเข้าด้วยกันจะกลายเป็นส่วนมาตรฐานของโมเดล 'ห่วงโซ่อุปทาน' ฮับต่างๆ มีจุดตรวจที่รวมเข้าด้วยกันนับพันจุดอยู่แล้ว และเครื่องมือต่างๆ เช่น ชุดผสานทำให้สูตรอาหารสามารถแชร์ได้ การวิจัยกำลังมุ่งไปสู่การค้นหาแบบผสานอัตโนมัติ (อัลกอริธึมวิวัฒนาการเลือกอัตราส่วนการผสมผสานแบบเลเยอร์) ผสานเข้ากับสถาปัตยกรรมที่แตกต่างกันเล็กน้อย และผสานส่วนประกอบ Mixture-of-Experts ได้ทันที เนื่องจากการปรับแต่งแบบเปิดแพร่หลาย การผสานรวมจึงเป็นวิธีที่แทบจะไม่มีค่าใช้จ่ายในการเขียนความสามารถ แม้ว่าการออกใบอนุญาตและแหล่งที่มาของโมเดลที่ผสานจะต้องมีมาตรฐานที่ชัดเจนกว่า

การใช้งานจริงในโลกแห่งความเป็นจริง

การผสมผสานโมเดลที่ปรับแต่งโค้ดเข้ากับโมเดลที่ปรับแต่งการแชท ดังนั้น LLM หนึ่งคนจึงเขียนโค้ดและสนทนาได้อย่างเป็นธรรมชาติ โดยไม่ต้องฝึกอบรมซ้ำ

การทดลองผสานเชิงวิวัฒนาการที่รวมแบบจำลองภาษาญี่ปุ่นเข้ากับแบบจำลองคณิตศาสตร์ภาษาอังกฤษเพื่อสร้างเครื่องมือแก้ปัญหาคณิตศาสตร์ที่แข็งแกร่งในภาษาญี่ปุ่น

การลบเวกเตอร์งาน 'ความเป็นพิษ' ออกจากน้ำหนักของแบบจำลองเพื่อลดผลลัพธ์ที่เป็นอันตรายโดยไม่ต้องรวบรวมข้อมูลความปลอดภัยใหม่

การรวมอะแดปเตอร์ LoRA หลายตัวที่ได้รับการฝึกสไตล์การเขียนที่แตกต่างกันเข้าไว้ในรุ่นเดียวที่สามารถเปลี่ยนโทนเสียงได้อย่างยืดหยุ่น

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Merging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การรวมโมเดลวิวัฒนาการ Sakana AI

คำถามที่พบบ่อย

What is Model Merging?

การรวมโมเดลจะรวมน้ำหนักของโครงข่ายประสาทเทียมที่ได้รับการฝึกตั้งแต่สองตัวขึ้นไปให้เป็นโมเดลเดียว โดยไม่ต้องมีการฝึกซ้ำหรือเข้าถึงข้อมูลการฝึกดั้งเดิมใดๆ สิ่งสำคัญคือช่วยให้ทีมผสมผสานทักษะเฉพาะทางได้ในราคาถูก โดยเปลี่ยนโมเดลที่ได้รับการปรับแต่งราคาแพงให้กลายเป็นแบบเอกสารสำเร็จรูปที่นำกลับมาใช้ใหม่ได้

การรวมโมเดลจะรวมอะไรเป็นหลัก?

การรวมโมเดลจะดำเนินการโดยตรงบนน้ำหนัก/พารามิเตอร์ที่เรียนรู้ของโมเดล โดยหลอมรวมเป็นชุดเดียว แทนที่จะรวมข้อมูลหรือเอาต์พุตรันไทม์

เหตุใดการรวมโมเดลจึงสามารถดำเนินการได้ภายในไม่กี่วินาทีบนฮาร์ดแวร์ขนาดเล็ก

เนื่องจากการผสานโดยพื้นฐานแล้วเป็นการคำนวณแบบถ่วงน้ำหนักเหนือน้ำหนักที่มีอยู่ จึงไม่มีการเผยแพร่กลับหรือการส่งผ่านข้อมูลที่มีค่าใช้จ่ายสูง

วิธีการเช่น TIES-Merging และ DARE แก้ไขปัญหาอะไรเป็นพิเศษ

TIES และ DARE ตัดและปรับขนาดเวกเตอร์งานเพื่อลดการอัปเดตที่ขัดแย้งกัน (เครื่องหมายตรงกันข้าม) ดังนั้นงานหนึ่งจะไม่เขียนทับงานอื่น

การรวมสามารถใช้เพื่อ *ลบ* พฤติกรรมที่ไม่พึงประสงค์ได้อย่างไร

การปฏิเสธ (การลบ) เวกเตอร์งานที่เชื่อมโยงกับลักษณะที่ไม่พึงประสงค์ เช่น ความเป็นพิษ สามารถทำให้แบบจำลองอยู่ห่างจากพฤติกรรมนั้นได้