密码学学者:沙箱难防更强模型,「弱模型监督强模型」不可持续

matthew_d_green · x · 2026-09-28

密码学家 Matthew Green 就 AI 安全沙箱讨论表态:当前模型尚未严重失准,沙箱在弱威胁模型(如 prompt injection、意外行为)下或许有效,OpenAI 在这方面的投入明显不够。但他认为沙箱不是长久之计——现有方案本质上都是「希望一个稍笨的模型能有效监督更聪明的模型」,这意味着你必须信任模型本身,而这在更强模型面前站不住脚。

所属事件:密码学家 Green:沙箱非万能,Agent 跨界数据流监控才是无解难题(6 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →