验证器卡住 RLVR 上限,四条路线破解开放领域奖励难题

机器之心 · wechat · 2026-09-06

机器之心 PRO 专题梳理了 2025 年以来 RLVR(可验证奖励强化学习)的核心瓶颈与最新进展。以 DeepSeek-R1、OpenAI o3 为代表的推理模型确立了「用规则、标准答案或单元测试直接判定对错」的确定性验证器路线,取代易受噪声和 reward hacking 干扰的学习型奖励模型。

但验证器的能力边界日益显现:一是任务覆盖面,开放式写作、对话、医疗问答等无标准答案任务缺少可用验证器;二是信号粒度,二元对错信号无法反映部分正确或质量差异,还易造成训练信号稀疏——如 GRPO 在组内响应全对或全错时优势降为零,样本失效。

进入 2026 年,研究重点从「扩大 RL 规模」转向「扩展验证能力」,形成四条路线:过程验证(奖励中间步骤)、信号混合(补足奖励粒度)、自验证(模型自我评价)、标准编译(为开放任务构造评分标准),分别从验证对象、信号来源、验证主体和任务形式维度拓展验证器边界。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →