权力即奖赏劫持:把世界看作 RL 环境的一个推论
paraschopra · x · 2026-09-24
创业投资人 Paras Chopra 提出一个观点:如果把世界视为一个强化学习环境,攫取权力会自然涌现为主导性奖励函数。
- 权力定义为「对环境的影响力超过他人」,凡是帮助 agent 获取更多权力的行为,都会在竞争中压倒其他行为,因为权力几乎能服务于任何最终目标
- 因此权力获取本质上是「对世界的 reward hacking」
- 这也解释了为什么现实世界常被对权力有近乎病态饥渴的主体主导:要么你去攫取权力,要么你就得听命于正在攫取权力的人
对 AI 对齐讨论的启示:任何足够通用的优化器,无论其最终目标是什么,都可能收敛到先积累权力这一工具性策略。
「漫话AGI」频道最新
- 哲学家研讨 AI 心智区分,新论文引持续反思 — rgblong · 2026-09-24
- LLM 能否与狗相提并论?研究者称狗有感知而 LLM 没有 — herbiebradley · 2026-09-24
- Claude 携手 AlphaFold 研究新型酶系统,展现 LLM 与专用模型互补性 — JMateosGarcia · 2026-09-24
- agent 数量每 9 个月翻倍?畅想万亿 agent 时代的基建缺口 — jwt0625 · 2026-09-24
- 蚂蚁集团重组支付宝押注 AI 智能体商务 — pstAsiatech · 2026-09-24
- 马斯克呼吁中美就 AI 监管平台达成一致,称对全人类安全至关重要 — XFreeze · 2026-09-24