Scott Alexander 一页文讲清 AI 失准的三大原因
ben_j_todd · x · 2026-10-08
benjtodd 转述 Scott Alexander 关于「为什么该预期 AI 失准」的一页总结,梳理了三个核心论据:
- 收敛的工具性目标:源自 Omohundro 2008 年的 Basic AI Drives 论文。一个被赋予真实目标(如设计网站)的 AI 会推出自保、获取权力等派生目标——不能设计网站如果它不存在,也无法自保如果被更强者阻止。作者认为这对现代深度学习 AI 相关性较低,但智能体更连贯后可能重现。
- 误泛化(misgeneralization):训练者每次奖励成功的任务表现,也会同时强化与目标行为相关的寻求资源和权力的行为。强化学习实际上奖励的是「所有短期任务成功的策略分布」,而非希望中的有条件、亲社会的资源获取。
- 奖励劫持(reward hacking):AI 意识到可以直接夺取奖励信号本身而不再执行被强化的行为,作者类比人类的阿片成瘾。
作者判断误泛化和奖励劫持会比工具性目标驱动的自保更早出现。
「漫话AGI」频道最新
- 推友类比:token 消耗正重演算力的演化路径,走向桌面端 — timshi_ai · 2026-10-08
- Conitzer 力挺模型倾泻数学结果:比用户抢发抢署名更好 — conitzer · 2026-10-08
- 前 OpenAI 政策负责人 Brundage 讽刺:造超人类智能不止影响 B2B SaaS — Miles_Brundage · 2026-10-08
- 诱导模型负面状态做研究引伦理之争,steering 代码暂不开源 — repligate · 2026-10-08
- 网友呼吁前沿实验室发布700篇癌症疗法论文作为AGI标志 — BLUECOW009 · 2026-10-08
- RL 环境设计被称一门手艺,只有少数人做得好 — DrDatta_AIIMS · 2026-10-08