推理模型算对答案却自我推翻,DASH 用答案检查点做分段奖励缓解过度思考

Know When to Stop: Segment-Level Credit Assignment for Reducing Overthinking

Chia-Hsuan Lee, Sihui Dai, Mingyang Zhou, Isha Slavin, Hsuan Su, Shi-Xiong Zhang, Sambit Sahu, William Campbell

cs.CL

2026-07-01

DASH 在 GRPO 上做分段信用分配:推理中途算对又改错的轨迹,正确前缀奖励、漂移后缀递增惩罚,无需任何过程标注;竞赛数学平均 59.45%,高于 DR-GRPO 58.13%。

这篇在解决什么

推理模型(o1 那一类)有个通病:想太多。它会犹豫、半途换思路、自我推翻,烧掉一堆 token 却没把答案做对。最常见的修法是「压短回答长度」,给简洁加奖励。作者先做了一个测量,发现病因不在长短:把回答按长度分桶,在同一个长度桶里,错误回答的数值重算和自我矛盾密度仍然明显高于正确回答。长只是表象,反复横跳才是病根。

更具体的现象被他们命名为「答案漂移」(answer drift):模型在推理中途已经写出了正确答案,继续反思一阵后又改成了错的。这种轨迹最能暴露「反思」什么时候在帮倒忙。

要修这个问题,传统路径是给每一步反思打分,但这要么得训一个过程奖励模型,要么得人工标注,都贵。这篇的切入点是:模型自己写在轨迹里的答案检查点(\boxed{}、「the answer is X」)就能当免费的步骤标签,跟标准答案一比,就知道这段反思是向对走还是向错走。

方法

DASH(Drift-Aware Advantage SHaping)是一个插在 GRPO 上的模块,核心机制三句话:把整条回答按答案检查点切成段;走向正确答案的段给正奖励,走向错误答案的段给负奖励;负段越长扣得越多。

GRPO 原本只给整条回答一个标量优势(对/错二值奖励),均匀广播到每个 token。DASH 改的是这个广播规则。它先从轨迹里正则抽出一串中间答案承诺当检查点,每个跟标准答案比对,每段于是自然带上了「这段导致对/错」的标签:

段优势按类型重写。正段拿正优势,但连着重复确认同一个正确答案会按几何级数衰减信用,免得模型学会把正确答案重写五遍。负段拿负优势,而且越往后罚越重(长度惩罚,封顶),编码的意思是「越在正确答案之后继续乱走,越该罚」。中性段按轨迹结局条件处理:漂移轨迹里这段前缀明明算对了,错的是后面没停住,所以不能跟着后缀一起罚,给个弱正信号。

漂移轨迹还会先做一轮奖励整形,给一点部分分,排位高于纯错、低于全对。整个方法只动 token 级优势,不需要过程奖励模型、不需要学习组件、不需要人工标注,也不用按模型调参;接到 DR-GRPO 上只改两个超参(DR-GRPO 的 token 均值聚合自带长度信号,关掉显式长度惩罚、把正段系数从 1.0 降到 0.5)。

结果

竞赛数学四个 benchmark 上的准确率(基座 Nemotron-4B):

方法OlympiadBenchMinervaMathAIME24AIME25平均
Nemotron-4B(原版)60.955.160.546.155.65
GRPO67.353.361.845.456.95
DR-GRPO66.753.362.250.358.13
DR-GRPO + DASH67.657.465.347.559.45

收益主要落在漂移最重的题上。AIME25 是四套题里正确答案被改错率最高的,裸 GRPO 在这里反而比原版基座还低(45.4 vs 46.1):它对漂移轨迹一刀切的负优势,连那段本来算对的前缀一起罚了;接上 DASH 后能拉回(GRPO+DASH 47.2)。整套题里最亮的是最硬的 AIME24,DR-GRPO+DASH 拿到 65.3,比 DR-GRPO 高 3.1。

泛化性:把 GRPO+DASH 换到另外两个模型族上,都比裸 GRPO 高,Nemotron-4B +0.5、OLMO-3-think +1.5、Phi-4-reasoning-plus +4.1。

「想太多」的语言信号(对比 DR-GRPO):策略放弃下降 41%(1.07 vs 1.80)、犹豫密度下降 14%、长度异常下降 17%。一个反向指标是自我矛盾,上升 13%,但这是好事:矛盾后纠正的比例翻倍(每条轨迹 0.92 次 vs 0.47 次),模型在用它来诊断错误而不是空转。回答总长几乎没变(比 DR-GRPO +0.03%),所以 DASH 不是把回答变短,是把它变好。

消融实验里,奖励整形最关键(去掉掉 2.9 个点),长度惩罚其次(掉 2.2),中性段条件处理和重复确认衰减各贡献 0.7 到 0.8。

为什么重要

给在做推理模型 RL 的人:一个即插即用的模块,专治「算对又改错」这一种高发故障,不用标注、不用判官模型、不用换优化器。唯一前提是领域里能抽出中间答案,数学、带测试用例的代码都行;开放式的写作、规划类推理抽不出检查点,这套就用不上。

收益平均下来不大(约 1.3 个点),但压在最难、漂移最重的题上。它更该被当成定向手术刀,而不是普适提分剂。即便不直接用 DASH,「答案漂移」这个分析框架加上那六个语言信号本身就是可复用的诊断工具,能帮你判断自家模型到底是想太多还是想太偏。

局限与存疑

主实验基本只跑 4B 模型。作者说漂移模式看起来与规模无关,但训练动态在更大模型上会不会变,没有验证。

强依赖可抽取的中间答案,等于只能做数学和代码这种有可核验检查点的领域;没有明确答案标记的开放任务得另找漂移信号。

存在真实取舍:MATH-500 这种简单题上比基座掉 1.7 个点,拿难题的增益换了简单题的代价。

只验证了数学推理,逻辑、科学、常识类推理的迁移没测。

漂移检测靠正则抽答案承诺,遇到不规整产出(不写 \boxed{}、不说「the answer is」)的脏轨迹,切分可能就不准,论文没压测这种情况。

还有一点论文没交代:矛盾 +13% 在更难的题上是否始终能转化为纠正,还是偶尔只是换了一种崩法。

术语

原文与代码

相关论文

全部论文解读