无需标准答案自我纠错:Qwen3-4B 数学成绩平均提升 7.5 个百分点

imjustnewatai · x · 2026-09-13

一篇 9 月 10 日预印本提出反直觉的训练思路:与其让模型模仿拿到标准答案的「老师」,不如让模型生成粗心的推理样本,再训练它远离这些自身放大的错误模式——训练数据中完全去掉了正确答案。在 Qwen3-4B 上的 7 个数学基准平均成绩:「避开自身推理缺陷」方法提升 7.5 个百分点,而「答案喂饱的老师」方法仅提升 1.0 个百分点;开启 thinking 模式后新方法仍有 3 个百分点增益。作者认为关键在于自我反馈回路:模型可以在不知道正确解的情况下为自我改进生成有效信号,并追问这条路在多远之前才真正需要更强的老师。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →