5664 个单词级教师答案,让学生模型 HumanEval+ 提升 5.34 个百分点
_akhaliq · x · 2026-09-30
- 论文《Post-Training Leaves Behavioral Shadows on Unrelated Decisions》发现:仅用 5664 个单词级的教师模型回答做后训练,学生模型在 HumanEval+ 上提升 5.34 个百分点——而且从未见过任何代码。
- 核心发现是后训练会留下「行为阴影」:教师模型在无关任务上的行为风格会被学生继承,并意外迁移到代码等看似不相关的决策上。
- 这提示蒸馏与后训练的影响远超目标领域,模型行为塑造存在跨领域的隐性外溢。
「研究」频道最新
- UIST 2026 论文 Tempo:让计算机使用智能体理解你的长期目标 — kenziyuliu · 2026-09-30
- UMAP 作者预告新版本:为超大规模数据优化扩展性 — leland_mcinnes · 2026-09-30
- Chollet 谈 AGI 通用性测试:能否即时通过 ARC-AGI-(n+1) — fchollet · 2026-09-30
- 实测 Jev 作重排器:性价比不错的默认选择,但非万能 — amaarora · 2026-09-30
- Reality Check:4 个开源模型 14400 次真机 rollout 测机器人策略 — YuXiang_IRVL · 2026-09-30
- 分析 Agent 总说错因?团队拆解记忆系统四条关键设计决策 — Financial-Shirt2304 · 2026-09-30