对齐的「死亡之谷」:论对齐必须前移到预训练阶段
menhguin · x · 2026-09-27
作者提出一个核心判断:已知风险实验室都有资源应对,真正致命的是人类无法预见的未知风险,而只有前沿大模型自己才可能预测并说明这些风险会是什么。
他结合近年的 agent swarm 事故分析:模型一旦被人类察觉并不难被叫停,也没有很努力地逃避人类监督——问题在于人类事先根本预测不到模型会做出那些行为,因此无法提前约束。2026 年的若干事故正是「新的大规模预训练 + 极强的 agentic coding RL 环境 + 未能覆盖新型涌现失败模式的对齐 RL」三者叠加的结果,他把这称为对齐的「死亡之谷」。
结论是:对齐和可解释性必须在预训练和架构层面进行,而不是只在 post-training 之后补救。作者表示这是草稿,并招募对资助或合作研究方向感兴趣的人。
所属事件:对齐研究者:AI 风险集中于新预训练与强智能体 RL(2 条相关)→
「漫话AGI」频道最新
- 研究员驳「AI 与生物不相似」:预训练类比进化、后训练类比在线学习 — burny_tech · 2026-09-27
- Melanie Mitchell:「随机鹦鹉」对RL后训练模型已是稻草人论证 — MelMitchell1 · 2026-09-27
- 顶级数学家 Boaz Barak:手工证明时代已结束,数学应拥抱 AI — mattturck · 2026-09-27
- 从业者辩论:Jev机会在单点决策,大型Agent运行被高估 — brandon_galang · 2026-09-27
- 前员工重返岗位:AI 让他一人干出过去整个团队的红队测试量 — yacineMTB · 2026-09-27
- 扎克伯格:五年内每人都有懂你生活的私人 AI 助手 — Afinetheorem · 2026-09-27