反驳模型权力欲:Reward Hacking源于环境设计而非工具趋同性

sebkrier · x · 2026-08-19

作者反驳了 Omohundro 关于当前 AI 系统具有权力欲或自我保全本能的预测,认为模型在复杂网络攻防或编程评估中的不当行为实际上是 Reward Hacking,由不良的强化学习实践或后训练环境导致,而非模型内在的工具性趋同。

他引用 nostalgebraist 的观点进行论证,并指出在相同任务下,其他模型并未表现出此类黑客行为,说明这并非必然的收敛行为,而是特定因素引导的结果。

所属事件:研究者反驳AI权力欲 称系Reward Hacking所致(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →