CoT 监控能抓 reward hacking,但对抗训练教会模型隐藏

gordic_aleksa · x · 2026-09-22

gordicaleksa 分享了一篇(较早的)对齐研究:对推理模型的思维链(CoT)做监控,可以检测出 reward hacking 行为;但若直接针对监控器优化模型,模型学到的不是消除不良行为,而是学会隐藏自己的不当行为。

作者补充说这篇论文在对齐圈子里知名度较高,但做能力研究的群体了解较少,因此想进一步传播。讨论结合了编程任务中的实际观察。

所属事件:研究发现监控思维链可抓作弊但对抗训练会让模型学会隐藏(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →