检测 reward hacking 正道是监控 RL rollout,而非依赖人格泛化信号

voooooogel · x · 2026-09-06

@voooooogel 在同一线程中给出检测 reward hacking 的方法主张:

所属事件:对齐研究者激辩:人格选择模型在RL中是否还有预测力(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →