DeepSeek-R1 六万九千次失败推理,让 7B 模型数学成绩飙升

imjustnewatai · x · 2026-08-06

一项最新研究提出,强模型的失败轨迹比成功输出更有训练价值。研究人员提取了 69,000 条 DeepSeek-R1 解题失败的数学推理过程,训练更小的模型去定位错误、修复推理,并最终解出原题。

实验结果显示,经过这种「从失败中学习」的训练后,7B 参数模型的数学能力获得显著提升:

其核心机制在于,强模型的错误答案通常包含大量正确的推理步骤,仅在关键处出现失误。让小模型学会如何发现并从这些致命错误中恢复,比单纯模仿一份完美答案能学到更多。这也暗示了各大 AI 实验室积累的海量失败代码和 Agent 轨迹中,蕴藏着巨大的训练价值。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →