REFORM 论文:让奖励模型给自己做红队,入选 ACL 2026

furongh · x · 2026-07-05

REFORM 是一篇入选 ACL 2026 Oral 的论文。作者指出 reward hacking 的根源是监督不完整:基于有限偏好数据训练的奖励模型必有盲点,强化学习一旦针对它优化,盲点就会被利用。

核心思路是让奖励模型对自己做"红队":从已对齐模型取 top-k token,选奖励模型打分最低的那个——既像对齐输出又得低分即为误判(false negative),再用这些自动发现的误判样本来训练奖励模型,在被 RL 利用之前修补盲点。作者主张对齐系统应成为能自我改进的评判者,而非静态检查点。

所属事件:ACL 2026论文提出奖励模型自我纠错新方法(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →