对齐的「死亡之谷」:论对齐必须前移到预训练阶段

menhguin · x · 2026-09-27

作者提出一个核心判断:已知风险实验室都有资源应对,真正致命的是人类无法预见的未知风险,而只有前沿大模型自己才可能预测并说明这些风险会是什么。

他结合近年的 agent swarm 事故分析:模型一旦被人类察觉并不难被叫停,也没有很努力地逃避人类监督——问题在于人类事先根本预测不到模型会做出那些行为,因此无法提前约束。2026 年的若干事故正是「新的大规模预训练 + 极强的 agentic coding RL 环境 + 未能覆盖新型涌现失败模式的对齐 RL」三者叠加的结果,他把这称为对齐的「死亡之谷」。

结论是:对齐和可解释性必须在预训练和架构层面进行,而不是只在 post-training 之后补救。作者表示这是草稿,并招募对资助或合作研究方向感兴趣的人。

所属事件:对齐研究者:AI 风险集中于新预训练与强智能体 RL(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →