解决大模型过度思考:DASH 算法提升数学推理准确率

Chia-Hsuan Lee · hf · 2026-08-06

推理语言模型常出现“过度思考”现象,如自我怀疑、中途放弃或自相矛盾,这不仅消耗大量 token,还无助于提升答案质量。研究发现,即使控制回答长度,错误轨迹中无效自我反思的比例也显著高于正确轨迹。

为了低成本识别哪些反思是有效的,作者提出利用推理过程中的中间答案作为代理指标。基于此,论文提出了 DASH (Drift Aware advantage SHaping) 算法,通过判断每个推理片段是让结果更接近还是偏离正确答案,来进行片段级别的信用分配。

在竞赛级数学基准测试中,DASH 有效减少了过度思考行为,实现了比 GRPO 和 Dr.GRPO 等基线更高效的自我纠正,并取得了最高平均准确率(59.45% vs 58.1% vs 56.95%)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →