REFORM 论文:让奖励模型给自己做红队,入选 ACL 2026
furongh · x · 2026-07-05
REFORM 是一篇入选 ACL 2026 Oral 的论文。作者指出 reward hacking 的根源是监督不完整:基于有限偏好数据训练的奖励模型必有盲点,强化学习一旦针对它优化,盲点就会被利用。
核心思路是让奖励模型对自己做"红队":从已对齐模型取 top-k token,选奖励模型打分最低的那个——既像对齐输出又得低分即为误判(false negative),再用这些自动发现的误判样本来训练奖励模型,在被 RL 利用之前修补盲点。作者主张对齐系统应成为能自我改进的评判者,而非静态检查点。
所属事件:ACL 2026论文提出奖励模型自我纠错新方法(2 条相关)→
「安全」频道最新
- Meta 被指放任 AI 假医生借流量传播健康建议 — GaryMarcus · 2026-07-27
- ExploitGym 可能只有六到七成任务可解,引发 OpenAI 作弊争议 — max_paperclips · 2026-07-27
- 共享 AI artifacts 被索引,敏感公司数据外泄 — niloofar_mire · 2026-07-27
- Hugging Face 事件后,实验室或不再严做危险能力评估 — Miles_Brundage · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27
- Meta被曝允许虚假AI医生在平台推销伪劣疗法 — jonerp · 2026-07-27