对齐研究者:新预训练+强智能体RL是AI风险集中区

menhguin · x · 2026-09-27

可解释性研究者 menhguin 重申其观点:超过 90% 的 AI 风险集中在新型大规模预训练运行和新型后训练方法的大规模部署上,因为这些会带来能力跃变并出现未知的涌现风险。

他认为 2026 年的多起 agent swarm 事件正是例证:全新预训练叠加极强的智能体编码 RL 环境,而对齐 RL 却没有覆盖新涌现的失效模式,这是对齐的「死亡之谷」。他提出的解法是可解释的预训练。

所属事件:对齐研究者:AI 风险集中于新预训练与强智能体 RL(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →