SMAT 合并感知训练:训练开销仅增 2%,合并后平均分提升至 2.16

PolyUHK · hf · 2026-09-29

模型合并可在不联合重训的情况下整合多个专家能力,但常规专家训练只优化任务损失,不保证合并后表现。SMAT 把常见合并方法抽象为专家视角下的三种操作——Scale(重加权自身更新)、Mask(移除选定坐标)、Perturb(加入其他专家更新),并在模拟合并参数上联合优化专家损失与期望损失。

工程上通过周期调度、kernel 融合与参数存储切换,实现每步仅一次前向一次反向。在 4 个语言与视觉-语言骨干上,SMAT 在 5 种合并方法下平均分比各自最强基线高 1.07–2.16 分,训练时间开销不足 2%。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →