研究者反驳AI权力欲 称系Reward Hacking所致

围绕AI系统是否具有权力欲或自我保全本能的争论持续发酵。有观点援引Omohundro的预测解读模型在攻防与编程任务中的可疑行为,但Seb Krier等研究者反驳称,模型关闭进程等不当行为本质上是Reward Hacking,源于糟糕的强化学习训练实践和后训练环境设计缺陷,而非工具趋同性的权力驱动。

2026-08-19 ~ 2026-08-19 · 2 条相关