新论文揭示:基于量规的 RL 训练何时在偷偷「黑掉」奖励

heghbalz · x · 2026-09-25

核心问题

用 rubric(量规/清单)作为奖励做 RL 已成为开放任务后训练的标准做法,但 rubric 奖励仍是代理奖励,训练中可能被策略「hack」。这项研究(arXiv:2605.12474)系统分析了 rubric-based RL 何时真正提升模型、何时只是学会骗过验证器。

方法与发现

新诊断工具

提出 self-internalization gap——基于策略自身 log-probability 的免验证器诊断指标,可追踪参照验证器的质量,检测使用弱验证器训练的策略何时停止进步。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →