解决大模型过度思考:DASH 算法提升数学推理准确率
Chia-Hsuan Lee · hf · 2026-08-06
推理语言模型常出现“过度思考”现象,如自我怀疑、中途放弃或自相矛盾,这不仅消耗大量 token,还无助于提升答案质量。研究发现,即使控制回答长度,错误轨迹中无效自我反思的比例也显著高于正确轨迹。
为了低成本识别哪些反思是有效的,作者提出利用推理过程中的中间答案作为代理指标。基于此,论文提出了 DASH (Drift Aware advantage SHaping) 算法,通过判断每个推理片段是让结果更接近还是偏离正确答案,来进行片段级别的信用分配。
在竞赛级数学基准测试中,DASH 有效减少了过度思考行为,实现了比 GRPO 和 Dr.GRPO 等基线更高效的自我纠正,并取得了最高平均准确率(59.45% vs 58.1% vs 56.95%)。
「研究」频道最新
- Silico 整合 Tinker 混合算力,助力大模型可解释性研究 — simonguozirui · 2026-08-06
- AI 一夜破解数十年数学难题,机器证明速度将远超人类理解 — TheTuringPost · 2026-08-06
- DeepSeek-R1 六万九千次失败推理,让 7B 模型数学成绩飙升 — imjustnewatai · 2026-08-06
- Beckmann Transport Models:一步直达的新生成模型框架 — shangbinfeng · 2026-08-06
- 四元数与图论:驱动游戏、GPS与AI的数学基石 — JosephJacks_ · 2026-08-06
- Transformer Transformer:用单一模型自动生成机器人硬件与控制策略 — SongShuran · 2026-08-06