Cliff 论文:从首个错误学习过程奖励改进 RLVR

作者与 Amazon AWS 合作发布 LLM 强化学习新论文《Cliff: Learning Process Rewards from the First Mistake》。该方法利用现成 LLM 检测模型推理链条中的第一个错误,并据此构造 token 级优势信号,从而改进带可验证奖励的强化学习(RLVR)中的过程奖励学习,让奖励塑造更聚焦于关键失误点。

2026-09-03 ~ 2026-09-05 · 2 条相关