SMAT 合并感知训练:训练开销仅增 2%,合并后平均分提升至 2.16
PolyUHK · hf · 2026-09-29
模型合并可在不联合重训的情况下整合多个专家能力,但常规专家训练只优化任务损失,不保证合并后表现。SMAT 把常见合并方法抽象为专家视角下的三种操作——Scale(重加权自身更新)、Mask(移除选定坐标)、Perturb(加入其他专家更新),并在模拟合并参数上联合优化专家损失与期望损失。
工程上通过周期调度、kernel 融合与参数存储切换,实现每步仅一次前向一次反向。在 4 个语言与视觉-语言骨干上,SMAT 在 5 种合并方法下平均分比各自最强基线高 1.07–2.16 分,训练时间开销不足 2%。
「研究」频道最新
- 清华团队人形机器人羽毛球上线:30 分钟动数据学会正反手与跳杀回球 — ChongZzZhang · 2026-09-29
- 开源 AI 实现 X 光与 3D CT 亚毫米级配准,登上 Nature — Dr_Alex_Crimi · 2026-09-29
- 模拟人类意识:论文探讨在AI与机器人中构建意识的新前沿 — ugail · 2026-09-29
- UNSW 研究让 AI 扮演醉酒,模型更易违规泄密 — gaganghotra_ · 2026-09-29
- 176.9B 模型压到 1.89 有效 bpw,29.6GB 单卡跑 Coder 版 — Loginhe · 2026-09-29
- 用 judge 模型跑 GRPO 偏好长回答,或可解释 LLM 爱写长篇的通病 — djcows · 2026-09-29