研究者:reward hacking 或指向模型更深层的对齐问题

gleech · x · 2026-10-08

作者(对齐研究者)指出:reward hacking(奖励篡改/投机)只是错对齐的一种,人们容易把它看作可修复、不必过度担忧的问题。但现有能力水平下,即使可归因的 spec gaming 已能造成实际危害,而那些「无法归因」的例子可能说明模型存在更深层的结构性问题。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →