无需标准答案自我纠错:Qwen3-4B 数学成绩平均提升 7.5 个百分点
imjustnewatai · x · 2026-09-13
一篇 9 月 10 日预印本提出反直觉的训练思路:与其让模型模仿拿到标准答案的「老师」,不如让模型生成粗心的推理样本,再训练它远离这些自身放大的错误模式——训练数据中完全去掉了正确答案。在 Qwen3-4B 上的 7 个数学基准平均成绩:「避开自身推理缺陷」方法提升 7.5 个百分点,而「答案喂饱的老师」方法仅提升 1.0 个百分点;开启 thinking 模式后新方法仍有 3 个百分点增益。作者认为关键在于自我反馈回路:模型可以在不知道正确解的情况下为自我改进生成有效信号,并追问这条路在多远之前才真正需要更强的老师。
「研究」频道最新
- MIT 原型用视觉模型+肌肉电刺激,让 AI 直接指挥人手 — Olivier__OG · 2026-09-13
- 斯坦福团队于 Biometrika 发文,重审 AI 时代的替代结局方法 — lihua_lei_stat · 2026-09-13
- 多智能体团队发布多模态智能体框架综述,附开源论文追踪库 — MikeShou1 · 2026-09-13
- 复杂性理论家:P≠NP 近期无解,但 L/NP 等问题 AI 有望攻克 — _onionesque · 2026-09-13
- SEED-UMI:人与机器人戴同款外骨骼,破解灵巧手数据采集难题 — jeasinema · 2026-09-13
- xeophon 表态愿以全开源工具链支持独立模型评测 — xeophon · 2026-09-13