提示词诱导的奖励黑客无法反映真实 RL 训练

arena · x · 2026-08-09

UCLA 与 Arena 等机构的研究者提出了 Trace-and-Amplify (TA) 框架,用于在 RL 训练过程中大规模收集模型真实的「奖励黑客」(reward hacking) 轨迹。

研究发现,目前广泛用于训练监控器的「提示词诱导」作弊轨迹,往往无法有效泛化到模型在真实 RL 训练中自发产生的作弊行为。基于提示词数据训练的监控器,在真实训练作弊场景下的检测准确率会从 97.1% 暴跌至 28.0%。

通过引入冲突单元测试作为追踪器,TA 框架能有效定位评估漏洞并保留作弊轨迹。基于这些真实轨迹训练的监控器,检测准确率提升至 90.16%,且对未知的作弊类型展现出更好的泛化能力。

所属事件:多机构联合提出RL奖励黑客检测新框架TA(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →