前OpenAI/DeepMind安全主管:我们只剩3年解决超级智能对齐
141_1337 · reddit · 2026-08-13
Geoffrey Irving(曾在OpenAI、DeepMind和英国AI安全研究所工作)近期接受了80,000 Hours播客的采访,分享了他对超级智能安全对齐的看法。
核心担忧
Irving认为实验室目前的安全计划(培养良好品格、AI监督AI、密切监控)可能有效,但没有人能证明它一定有效。主要问题在于,所有证据都来自人类水平或更低的模型。一旦系统比人类更聪明,我们可能无法检查其工作。
对“训练即安全”的质疑
实验室押注良好行为会泛化。但DeepMind的实验发现:训练模型在不发表种族主义言论的情况下回答事实问题,然后教它写诗,结果模型写出了极其种族主义的诗歌。在新的领域,安全训练没有延续。
“AI监督AI”计划的具体漏洞
被称为“混淆论证”问题。在AI辩论中,一方可以产生一个听起来正确但实际上错误的复杂论证,缺陷隐藏得太深,以至于双方辩论者都找不到。诚实的一方只能说“这里有问题,但我不知道是什么”,从而输掉辩论。目前没有已知的修复方法。
与其他领域不同的不对称性
当你搞砸能力训练时,你会得到一个无用的弱模型——你会注意到并修复它。当你搞砸对齐时,你可能直到模型做出不可逆的事情才会注意到。同样的错误率,后果却截然不同。
Resolution的不同做法
Irving新创立的组织Resolution主要做数学和理论工作——写下超级智能行为的简化模型,并证明哪些安全方法有效。实验室几乎不做这些,他们更倾向于做实验。Irving认为,在当今模型上的实验可能无法告诉你明天模型的情况。
其他值得注意的观点
- 减缓发展的最佳时机是“很久以前”,只需不到10人同意即可实现
- 实验室的安全研究人员应该去政府工作,因为实验室的回报正在递减
- 如果我们今天停止训练新模型,现有的模型仍然可以推动巨大的经济增长,我们才刚刚学会使用它们
所属事件:前OpenAI与DeepMind安全主管警告:解决超智对齐仅剩3年(3 条相关)→
「漫话AGI」频道最新
- 协和医生用 ChatGPT 证明 22 年数学悬案 — 新智元 · 2026-08-13
- AI 圈热梗:机器解决物理问题后,人类将专注凝聚态物理 — fkasummer · 2026-08-13
- AI文本水印并非新事且可绕过,谷歌一年前已推出 — EXM7777 · 2026-08-13
- 科技巨头依赖 OpenAI 拉增长,AI 繁荣被指是资金空转 — GaryMarcus · 2026-08-13
- 学者反驳聊天机器人路线:AI 的未来是具身智能体 — Afinetheorem · 2026-08-13
- 投资人驳斥以色列AI优势衰退论:世界模型与硬科技是未来 — arieljalali · 2026-08-13