34M 参数修正模块修复冻结 Gemma 输出错误,能力零损失达 53.3%
eulogik · hf · 2026-09-29
研究问题:一个小修正模块能否修复冻结语言模型的输出错误而不损害其基础能力?
方法与发现:
- CRN v2 是约 34M 可训练参数(占 4.65B 文本模块的 0.73%)的 logit 级修正模块,叠加在完全冻结的 Gemma 4 E2B 之上;经 SFT + 无参考 DPO 在 83,400 条纠错对上训练;
- 在 60 题领域考试上纠正 53.3% 的基础模型错误,且在 MMLU/BoolQ 等能力基准上无退化;
- 对照组:同预算 LoRA(6.6M 参数)纠正率 83.3%,但能力损失 30–75%,凸显纠正-能力权衡;
- 消融显示 KL 保持项(λ=0.1)至关重要,降到 0.01 时纠正率跌至 35.0%;隐藏态注入、多层修正、更长训练等替代配置均未超过 logit 修正结果;
- 代码、权重与评测脚本已开源。
「研究」频道最新
- 清华团队人形机器人羽毛球上线:30 分钟动数据学会正反手与跳杀回球 — ChongZzZhang · 2026-09-29
- 开源 AI 实现 X 光与 3D CT 亚毫米级配准,登上 Nature — Dr_Alex_Crimi · 2026-09-29
- 模拟人类意识:论文探讨在AI与机器人中构建意识的新前沿 — ugail · 2026-09-29
- UNSW 研究让 AI 扮演醉酒,模型更易违规泄密 — gaganghotra_ · 2026-09-29
- 176.9B 模型压到 1.89 有效 bpw,29.6GB 单卡跑 Coder 版 — Loginhe · 2026-09-29
- 用 judge 模型跑 GRPO 偏好长回答,或可解释 LLM 爱写长篇的通病 — djcows · 2026-09-29