加载中...

模型合并(Model Merging)指不进行任何梯度训练,直接在参数空间对多个模型的权重进行组合,得到兼具各方能力的新模型。参与合并的模型通常源自同一基座的不同微调版本。
最简单的是权重线性平均(model soup);SLERP 沿球面插值以保持权重范数;任务向量(task arithmetic)方法把「微调权重减基座权重」视为可加减的能力向量;TIES、DARE 等进一步通过修剪冗余增量、解决符号冲突来减少多模型间的相互干扰。开源工具 mergekit 集成了这些算法,是社区合并模型的标准工具。
模型合并成本极低(只需 CPU 与内存),被广泛用于融合不同风格或领域的微调模型;权重平均思想也用于训练内部,如对训练末期多个检查点取平均以提升稳定性。
仅适用于结构相同且同源的模型;能力融合并非线性叠加,效果需实测验证,合并也可能稀释安全对齐等特性。

登录 后参与讨论
暂无讨论,来发表第一条评论吧