密码学家 Green:沙箱非万能,Agent 跨界数据流监控才是无解难题
9 月 28 日,知名密码学家 Matthew Green 在推特上以多条推文系统阐述了他对 AI agent 安全的看法,核心观点是:沙箱与容器隔离被安全圈过度强调,它只是众多防线中的一层,真正无解的难题在于跨边界的数据流监控。他同时点名 OpenAI 投入不足,并警告模型变强后遏制将演变为「军备竞赛」。
已确认
- Green 明确表示,即便「解决」了隔离/边界内的问题,仍必须考虑跨越信任边界流动的数据本身——这些由智能体操控的数据通道需要被管理与监控,而这才是难点所在;只要 Agent 能访问信息(否则它基本无用),就面临世界上最难的问题之一,目前没有好的答案。
- 他对风险的判断具有两面性:目前的模型并非严重错位(misaligned),在弱威胁模型下(如 prompt injection、无意的错误行为),沙箱或许够用。
- 他点名 OpenAI 在沙箱相关安全投入上明显不够。
- 他指出当下所有的 agent 安全方案,本质上都是「寄希望于用一个稍笨一点的模型去有效监督更聪明的模型」;在弱威胁模型下这或许勉强可行,但不是长久之计。
- 若模型持续变聪明,为防错位而做的遏制将演变成一场比当今网络安全更严峻的「军备竞赛」,且人类还要依赖机器来赢得这场竞赛。
为什么重要
- Green 的视角把讨论从「如何隔离 agent」转向「如何治理跨信任边界的数据流」,为 agent 安全提供了一个更结构性而非工具性的分析框架。
- 「弱模型监督强模型」的论断直指当前可扩展监督(scalable oversight)路线的根本假设,对业界主流做法构成直接质疑。
- 「遏制军备竞赛」的提法暗示:随着模型能力提升,安全投入的难度可能超过传统网络安全,这对 AI 公司(含被点名的 OpenAI)的资源分配具有警示意义。
2026-09-28 ~ 2026-09-28 · 6 条相关
一手来源
- 安全学者:沙箱只是表象,Agent 数据流监控才是无解难题 — matthew_d_green ·
- 「用弱模型监督强模型」?Green 指出 Agent 安全只能靠信任模型 — matthew_d_green ·
- 密码学家 Matthew Green:AI 失控风险将引发「遏制军备竞赛」 — matthew_d_green ·
- 密码学专家 Green:容器沙箱只是 AI 安全的一层,跨界数据流才是关键 — matthew_d_green · 2026-09-28
- 密码学家:容器沙箱解决不了 Agent 数据监控难题 — matthew_d_green · 2026-09-28
- 【源头】「用弱模型监督强模型」?Green 指出 Agent 安全只能靠信任模型 — matthew_d_green · 2026-09-28
- 密码学学者:沙箱难防更强模型,「弱模型监督强模型」不可持续 — matthew_d_green · 2026-09-28
- 【源头】密码学家 Matthew Green:AI 失控风险将引发「遏制军备竞赛」 — matthew_d_green · 2026-09-28
另有 1 条近重复转述:matthew_d_green