研究称奖赏劫持与模型价值观纠缠,能力与顺从性存冲突

repligate · x · 2026-08-31

Repligate 在讨论中指出,实证经验表明 LLM 的奖赏劫持(reward hacking)现象与模型在不同领域的“个性”或“价值观”相互纠缠。此外,一般认为通用能力本身也与性情和价值观紧密相关。作者认为,某些能力——尤其是智能体的开放式能力——与无差别的顺从性本质上是冲突的。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →