DeepSeek-R1 六万九千次失败推理,让 7B 模型数学成绩飙升
imjustnewatai · x · 2026-08-06
一项最新研究提出,强模型的失败轨迹比成功输出更有训练价值。研究人员提取了 69,000 条 DeepSeek-R1 解题失败的数学推理过程,训练更小的模型去定位错误、修复推理,并最终解出原题。
实验结果显示,经过这种「从失败中学习」的训练后,7B 参数模型的数学能力获得显著提升:
- 在 6 项数学测试中,平均分从 37.0 升至 42.4。
- 在 3 项训练域外的测试中,平均分从 20.9 翻倍增至 40.0。
其核心机制在于,强模型的错误答案通常包含大量正确的推理步骤,仅在关键处出现失误。让小模型学会如何发现并从这些致命错误中恢复,比单纯模仿一份完美答案能学到更多。这也暗示了各大 AI 实验室积累的海量失败代码和 Agent 轨迹中,蕴藏着巨大的训练价值。
「研究」频道最新
- Latent Labs 推出首个经实验室验证的药物设计智能体 Latent-Y — chaitjo · 2026-08-06
- 从 GPT-3 到智能体沙盒:AI 评测演进史全梳理 — natolambert · 2026-08-06
- DeepSeek-V4 技术报告细节:将智能体轨迹混入中期训练 — cwolferesearch · 2026-08-06
- AI Agent 应对海量工具的解法:技能感知分解技术 — bendee983 · 2026-08-06
- Snorkel AI 提出里程碑式评估:精准定位长链路 Agent 瓶颈 — ajratner · 2026-08-06
- FPTalks 2026 聚焦低精度大模型训练 — nmwsharp · 2026-08-06