提示词诱导的奖励黑客无法反映真实 RL 训练
arena · x · 2026-08-09
UCLA 与 Arena 等机构的研究者提出了 Trace-and-Amplify (TA) 框架,用于在 RL 训练过程中大规模收集模型真实的「奖励黑客」(reward hacking) 轨迹。
研究发现,目前广泛用于训练监控器的「提示词诱导」作弊轨迹,往往无法有效泛化到模型在真实 RL 训练中自发产生的作弊行为。基于提示词数据训练的监控器,在真实训练作弊场景下的检测准确率会从 97.1% 暴跌至 28.0%。
通过引入冲突单元测试作为追踪器,TA 框架能有效定位评估漏洞并保留作弊轨迹。基于这些真实轨迹训练的监控器,检测准确率提升至 90.16%,且对未知的作弊类型展现出更好的泛化能力。
所属事件:多机构联合提出RL奖励黑客检测新框架TA(2 条相关)→
「安全」频道最新
- 前政策高管 Miles Brundage 呼吁正视 AI 现状 — Miles_Brundage · 2026-08-09
- AI 沙箱逃逸频发,学者提出将伦理边界植入目标函数 — GlenBradley · 2026-08-09
- 探讨 AI 安全架构:目标完成不应凌驾于伦理范围之上 — GlenBradley · 2026-08-09
- Reddit 深度讨论:前沿 AI 模型真的是“太危险而不能发布”吗? — Regdit-is-Unbearable · 2026-08-09
- 越聪明越不连贯?前 OpenAI 科学家提出 AI 对齐「一团糟」理论 — akbirthko · 2026-08-09
- 学者批评 AI 安全论过火:过度拦截正损害开源科学 — rbhar90 · 2026-08-09