模型合併
模型合併將兩個或多個經過訓練的神經網路的權重合併為一個模型,無需任何重新訓練或存取原始訓練資料。
概述
It matters because it lets teams blend specialized skills cheaply, turning expensive fine-tuned models into reusable building blocks.
深入探討
模型合併融合了共享相同架構的多個模型的實際參數(權重)。最簡單的方法是權重平均,只需取對應權重的平均值。更聰明的方法使用「任務向量」——微調模型與其基礎之間的差異。增加任務向量會注入技能;減去它可以消除不必要的行為。 TIES-Merging 和 DARE 等技術會修剪和重新調整這些向量,以減少組合多個模型時的干擾。由於不需要梯度下降或數據,因此合併在筆記型電腦上只需幾秒鐘即可運行。問題是:它僅在模型從公共基礎下降並位於權重空間的兼容區域時才起作用。
技術洞察
關鍵思想是微調沿著基本模型附近相對平坦的「損失盆地」移動權重。任務向量很簡單(微調權重減去基本權重)。由於這些向量大致是線性的,並且在不同的任務中通常接近正交,因此您可以將多個向量添加在一起,並且組合模型保留每項技能。 TIES 和 DARE 首先修剪小的或衝突的權重增量以減少符號分歧,然後合併,防止一項任務覆蓋另一項任務。
戰略影響
成本與預算
多年來,架構決策決定著效能和營運成本。
更明確的決策
技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。
品質管控
更好的工程選擇可以減少生產中的可靠性事故。
模型合併的未來
預計合併將成為「供應鏈」模型的標準組成部分。集線器已經託管了數千個可合併的檢查點,而像 mergekit 這樣的工具使食譜可以共享。研究正在轉向自動合併搜尋(選擇逐層混合比率的演化演算法)、跨略有不同的架構進行合併,以及即時合併專家混合組件。隨著開放微調的激增,合併提供了一種近乎免費的方式來組合功能,儘管合併模型的許可和來源將需要更清晰的標準。
現實世界的實施
將編碼調整模型與聊天調整模型混合在一起,使法學碩士既可以自然地編寫程式碼又可以自然地交談,而無需重新培訓。
進化合併實驗將日文模型與英語數學模型結合,產生強大的日文數學解算器。
從模型的權重中減去「毒性」任務向量,以減少有害輸出,而無需收集新的安全資料。
將多個經過不同書寫風格訓練的 LoRA 轉接器合併為一個可以靈活切換語氣的模型。
風險與防護欄
優化一項基準測試可以隱藏更廣泛的系統弱點。
基礎設施和維護成本常常被低估。
隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。
實施路線圖
在實施之前定義延遲、品質和成本目標。
在實際負載和資料條件下進行基準測試。
儀器監控錯誤、漂移和使用者影響。
在擴展之前準備回滾和事件回應路徑。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Merging quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Model Merging?
模型合併將兩個或多個經過訓練的神經網路的權重合併為一個模型,無需任何重新訓練或存取原始訓練資料。這很重要,因為它可以讓團隊以低廉的成本融合專業技能,將昂貴的微調模型轉變為可重複使用的構建塊。
模型合併主要結合什麼?
模型合併直接對學習到的模型權重/參數進行操作,將它們融合成一組,而不是組合資料或運行時輸出。
為什麼模型合併可以在普通硬體上在幾秒鐘內運行?
因為合併本質上是對現有權重的加權算術,所以不涉及昂貴的反向傳播或資料傳遞。
TIES-Merging 和 DARE 等方法具體解決了什麼問題?
TIES 和 DARE 會修剪和重新調整任務向量以減少衝突(相反符號)更新,因此一項任務不會覆蓋另一個任務。
如何使用合併來「消除」不良行為?
否定(減去)與不必要的特徵(例如毒性)相關的任務向量可以使模型遠離該行為。