技术指南

模型合并

模型合并将两个或多个经过训练的神经网络的权重合并为一个模型,无需任何重新训练或访问原始训练数据。

阅读时间:2分钟最后更新

概述

It matters because it lets teams blend specialized skills cheaply, turning expensive fine-tuned models into reusable building blocks.

深入探讨

模型合并融合了共享相同架构的多个模型的实际参数(权重)。最简单的方法是权重平均,只需取相应权重的平均值。更聪明的方法使用“任务向量”——微调模型与其基础之间的差异。添加任务向量会注入技能;减去它可以消除不需要的行为。 TIES-Merging 和 DARE 等技术会修剪和重新调整这些向量,以减少组合多个模型时的干扰。由于不需要梯度下降或数据,因此合并在笔记本电脑上只需几秒钟即可运行。问题是:它仅在模型从公共基础下降并位于权重空间的兼容区域时才起作用。

技术洞察

关键思想是微调沿着基本模型附近相对平坦的“损失盆地”移动权重。任务向量很简单(微调权重减去基本权重)。由于这些向量大致是线性的,并且在不同的任务中通常接近正交,因此您可以将多个向量添加在一起,并且组合模型保留每项技能。 TIES 和 DARE 首先修剪小的或冲突的权重增量以减少符号分歧,然后合并,防止一项任务覆盖另一项任务。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

模型合并的未来

预计合并将成为“供应链”模型的标准组成部分。集线器已经托管了数千个可合并的检查点,并且像 mergekit 这样的工具使食谱可以共享。研究正在转向自动合并搜索(选择逐层混合比率的进化算法)、跨略有不同的架构进行合并,以及即时合并专家混合组件。随着开放微调的激增,合并提供了一种近乎免费的方式来组合功能,尽管合并模型的许可和来源将需要更清晰的标准。

现实世界的实施

将编码调整模型与聊天调整模型混合在一起,使法学硕士既可以自然地编写代码又可以自然地交谈,而无需重新培训。

进化合并实验将日语模型与英语数学模型相结合,产生强大的日语数学求解器。

从模型的权重中减去“毒性”任务向量,以减少有害输出,而无需收集新的安全数据。

将多个经过不同书写风格训练的 LoRA 适配器合并为一个可以灵活切换语气的模型。

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Merging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

Sakana AI 进化模型合并

常见问题

What is Model Merging?

模型合并将两个或多个经过训练的神经网络的权重合并为一个模型,无需任何重新训练或访问原始训练数据。这很重要,因为它可以让团队以低廉的成本融合专业技能,将昂贵的微调模型转变为可重复使用的构建块。

模型合并主要结合什么?

模型合并直接对学习到的模型权重/参数进行操作,将它们融合成一组,而不是组合数据或运行时输出。

为什么模型合并可以在普通硬件上在几秒钟内运行?

因为合并本质上是对现有权重的加权算术,所以不涉及昂贵的反向传播或数据传递。

TIES-Merging 和 DARE 等方法具体解决了什么问题?

TIES 和 DARE 会修剪和重新调整任务向量以减少冲突(相反符号)更新,因此一项任务不会覆盖另一项任务。

如何使用合并来“消除”不良行为?

否定(减去)与不需要的特征(例如毒性)相关的任务向量可以使模型远离该行为。