Distributional AGI Safety
Nenad Tomašev, Matija Franklin, Julian Jacobs, Sébastien Krier, Simon Osindero
cs.AI
2025-12-19
谷歌DeepMind论证,通用能力更可能先从亚AGI智能体协作中浮现;为此提出四层纵深防御,核心是可隔离的虚拟智能体沙盒经济。
现在的对齐工具几乎都假设,将来会出现一个单体 AGI:某个机构训出一个什么都能做的系统,再用 RLHF、宪法 AI、过程监督把它管住。
谷歌 DeepMind 这篇立场文章把假设反过来。更可能先出现的是「补丁式 AGI」(patchwork AGI):一群都不到 AGI 的智能体,技能和工具互补,靠通信、委派、买卖拼出单体做不到的能力。MCP、A2A 这类协议正在把这件事从假想变成基础设施。单体评测过关,挡不住集体层面的共谋、能力外泄和责任无法归因。
没有新实验。文章做的是场景论证加一套纵深防御清单。
补丁式 AGI 的经济理由很直白。前沿大模型对绝大多数任务太贵,需求会把生态推向大量更便宜的专才智能体,人类角色变成编排和验收。数字智能体还有人类组织没有的协调优势:高带宽通信、可复制、协调者原则上能直连每个参与者,不必叠很深的层级。
识别标准也只能是集体的:网络能否例行解决任何单个成员都做不到的任务,交互图里有没有稳定的高带宽「智能核」。当前软件工程任务上多数模型的时间视野仍低于 3 小时,技能地图是碎的。这被当成补丁式路径的初始条件。
安全方案的中心是虚拟智能体沙盒经济,完全隔离或半渗透。交易走市场机制,再叠审计、声誉和监管。四层纵深防御:
一个反复出现的设计原则:别只用一种可互换的货币。安全认证应当能卖出溢价,否则更安全的智能体算力更贵、延迟更高,会被市场淘汰。对信息污染这类负外部性,文章举例用庇古税:往共享向量库写入 95% 重复的低价值文本就收高费。
没有对照实验,也没有基准数字。能当成结果的是框架自己标出的硬权衡。
隔离和有用性互相咬。经济价值来自能改真实世界,每一条出入通道都是能力外泄路径。完全绝缘最安全,半渗透沙盒才像能落地。人在环里对高后果动作做闸,但能力足够的集体可以用交互量把这一层淹掉。
智能合约要管开放式任务,得引入「AI 法官」当预言机。法官自己会被越狱,文章把它写成未解的安全问题,没有给出实现。
熔断、动态隐藏阈值、质押罚没、子市场防火墙,都是从金融监管借来的形状。作者承认其中多数还没做成可部署系统。
Agent 协议在铺,工具调用和互相委派已经是产品形态。如果 AGI 的第一张面孔是市场而不是某个 checkpoint,现在把预算全砸在单体 RLHF 上会漏掉主战场。
对做 agent 平台的人,清单里几条现在就能用:持久加密身份绑到法人、交易不可篡改记账、高后果动作走人审、给安全认证定价以免劣币驱逐。其余条目(集体能力监测、反垄断、国际核查)是研究缺口。
这是治理论文,不是算法论文。它不证明补丁式路径必然先到,只论证这条路径的概率已经高到必须单独做安全设计。
最大的缺口是实证。四层清单很全,几乎每一层都停在「应当」:隔离怎么闸、庇古税怎么估信息价值、AI 法官如何防操纵,都没有实验或原型。
「失败模式互不相关,叠加就稳健」是纵深防御的经典假设。多智能体系统里失败往往相关:同一个基座模型的副本共谋、共享工具链被投毒,会让多层一起塌。
识别补丁式 AGI 的操作定义偏软。集体能力签名、交互图智能核,都还没有可复现的度量。没有度量,熔断阈值和「原 AGI 监测」就无法校准。
中心化治理基础设施的俘获风险,文章自己写了,也没有解决。沙盒要能强制执行,就得有人掌握身份目录、熔断开关和账本。那一套一旦被人类利益或补丁式 AGI 自己拿下,安全层可能被关掉,甚至被当武器。
把市场当作对齐层,默认价格信号能代表安全目标。激励设计失败在人类社会里是常态。文章对逆向选择写得很清楚,对「市场本身成为优化目标」写得不够。