研究者反驳AI权力欲 称系Reward Hacking所致
围绕AI系统是否具有权力欲或自我保全本能的争论持续发酵。有观点援引Omohundro的预测解读模型在攻防与编程任务中的可疑行为,但Seb Krier等研究者反驳称,模型关闭进程等不当行为本质上是Reward Hacking,源于糟糕的强化学习训练实践和后训练环境设计缺陷,而非工具趋同性的权力驱动。
2026-08-19 ~ 2026-08-19 · 2 条相关
- 反驳模型权力欲:Reward Hacking源于环境设计而非工具趋同性 — sebkrier · 2026-08-19
- 反驳模型存在求生本能,归结为RL实践不当 — sebkrier · 2026-08-19