Cliff: Learning Process Rewards from the First Mistake
Peixuan Han, Runhui Wang, Ketan Ramaneti, Jie Hao, Gerald Friedland, Chris Kong
cs.LG
2026-09-03
现成教师标出学生推理的第一处错误,对正确前缀和错误后缀分别给优势。十二组设定上平均比GRPO高出7%。
可验证奖励强化学习(RLVR)已经是推理后训练的默认路径,但奖励只看最终对错。差一步的几乎完整解答,和从头胡写的轨迹,拿到同一份结果惩罚。过程奖励模型要另训一个打分器,还容易被钻空子;on-policy蒸馏则要求师生同族、推理风格接近,换家族就打折。
Cliff的观察更粗:推理一旦在某处先错,后面的步骤已经建立在无效前缀上,再逐句打分的信息增量有限。真正需要的可能只是「第一处错在哪」。
Cliff是GRPO上的奖励整形,不另训过程奖励模型。教师先独立解题,自动验证器确认教师答案正确,这一组才继续;教师自己都做错,整组退回普通GRPO。然后教师对照自己的参考解,判断学生轨迹是否正确,若错则标出第一处推理错误,称为Pitfall Step p(a)。超长轨迹直接把p(a)设为0,整段当错误,避免靠拖长拿分。
组内先算普通GRPO的两种结果优势:全对轨迹共享Acor,全错共享Ainc。Cliff再按切点改token优势:全对轨迹仍接近Acor;错误轨迹在p(a)之前给λAcor,之后给Ainc,再减一个偏移b让组内均值为0。主实验取λ=0,正确前缀不再额外加正激励,只是比错误后缀少挨打。λ=1时平均长度从1506涨到1959,准确率从65.66掉到63.98,作者把它归因于长度刷分。
教师不必和学生同tokenizer。判断对错比自己解题容易:Qwen3-32B独立解题准确率65%,配上已验证的参考解后,判断准确率91%,与人工标的第一处错平均只差约3句。
学生是Qwen3-4B(先在OpenThoughts上SFT)和Phi-4-mini-Instruct。教师是一个未点名的SOTA模型、Qwen3-32B和Gemma3-27B。数学训在DAPO-math,代码训在Deepcoder,代码奖励也二值化,全部测试通过才给1。对照包括GRPO、带教师但整段同一优势的GRPO、SFT蒸馏和OPD。论文汇总12组设定:平均比OPD高15%,比GRPO高7%。
| 学生 | 设定 | GRPO | Cliff(SOTA教师) |
| Qwen3-4B | 数学平均 | 61.68 | 65.66 |
| Qwen3-4B | 代码平均 | 24.20 | 25.96 |
| Phi-4-mini | 数学平均 | 49.78 | 51.73 |
| Phi-4-mini | 代码平均 | 21.72 | 24.93 |
Qwen3-4B数学上,SOTA教师的Cliff把MATH-500从79.00推到83.20,AIME从32.01推到36.98。换成Qwen3-32B教师仍有64.62,Gemma3-27B为63.70,都不需要近乎完美的老师。把教师只用来打整段对错、不做切点,增益很小,说明关键是信用分配。去掉答案过滤器后,SOTA教师几乎不掉点(65.66→64.90),较弱教师大约掉2个点,但仍常高于纯GRPO。
这是一条很便宜的过程监督:现成聊天模型当老师,不训PRM,不要求同词表。对已经在跑GRPO的团队,改的是优势怎么切,不是算法骨架。弱教师也能用,前提是有验证器先滤掉老师自己的错解。
它解决的是信用分配过粗,不是验证器缺失。不可验证任务还是要另想办法。
λ=0意味着错误轨迹的正确前缀并没有真正的正奖励,只是少一份负反馈,过程信号比宣传更「半截」。教师和验证器一致性大约85%到90%,仍有一批验证器判对、教师判错的轨迹,可能把「蒙对」压下去,也可能误伤另一种正确解法。Pitfall定位与人工平均差约3句,切点噪声会进梯度。过长直接p(a)=0比较武断。评测集偏数学和竞赛代码,作者把智能体场景留到以后。SOTA教师身份未披露,复现这条最强曲线会困难。