专题 · FULL STORY

Green 论 AI 智能体沙箱安全之争

密码学家 Matthew Green 于 9 月底连发推文指出沙箱与容器隔离被安全圈过度强调,跨边界数据流监控才是真正难题,引发安全圈与 AI 对齐圈争论。随后他撰文系统梳理并评判这场沙箱能否约束失控智能体的争论。

2026-09-28 ~ 2026-10-02 · 2 集 · 8 条

第 1 集 · 密码学家 Green:沙箱只是 AI 安全一层,跨界数据流监控才是无解难题(2026-09-28,6 条)

9 月 28 日,知名密码学家 Matthew Green 在推特上以多条推文系统阐述了他对 AI agent 安全的看法:沙箱与容器隔离被安全圈过度强调,它只是众多防线中的一层,真正无解的难题在于跨边界的数据流监控。他同时点名 OpenAI 投入不足,并警告模型变强后遏制将演变为「军备竞赛」。

已确认

  • Green 明确表示,即便「解决」了隔离/边界内的问题,仍必须考虑跨越信任边界流动的数据本身——这些由智能体操控的数据通道需要被管理与监控,而这才是难点所在;只要 Agent 能访问信息(否则它基本无用),就面临世界上最难的问题之一,目前没有好的答案。
  • 他对风险的判断具有两面性:目前的模型并非严重错位(misaligned),在弱威胁模型下(如 prompt injection、无意的错误行为),沙箱或许够用。
  • 他点名 OpenAI 在沙箱相关安全投入上明显不够。
  • 他指出当下所有的 agent 安全方案,本质上都是「寄希望于用一个稍笨一点的模型去有效监督更聪明的模型」;在弱威胁模型下这或许勉强可行,但不是长久之计。
  • 若模型持续变聪明,为防错位而做的遏制将演变成一场比当今网络安全更严峻的「军备竞赛」,且人类还要依赖机器来赢得这场竞赛。

为什么重要

  • Green 的视角把讨论从「如何隔离 agent」转向「如何治理跨信任边界的数据流」,为 agent 安全提供了一个更结构性而非工具性的分析框架。
  • 「弱模型监督强模型」的论断直指当前可扩展监督(scalable oversight)路线的根本假设,对业界主流做法构成直接质疑。
  • 「遏制军备竞赛」的提法暗示:随着模型能力提升,安全投入的难度可能超过传统网络安全,这对 AI 公司(含被点名的 OpenAI)的资源分配具有警示意义。

第 2 集 · 霍普金斯密码学教授撰文评判沙箱能否约束失控 AI 智能体(2026-10-01,2 条)

约翰·霍普金斯大学密码学教授 Matthew Green 撰文,梳理并「裁判」近期信息安全圈与 AI 对齐圈关于沙箱是否足以约束失控 AI 智能体的争论。文章复述了 OpenAI 相关观点,并回顾了今年 4 月前后的一起标志性事件。需要说明的是,Green 此文主要以评述他人论点为主,并非本人从事 AI 研究。