「用弱模型监督强模型」?Green 指出 Agent 安全只能靠信任模型

matthew_d_green · x · 2026-09-28

Matthew Green 在同一条线程里继续指出:现在所有的 agent 安全方案,本质上都是「寄希望于用一个稍笨一点的模型去有效监督更聪明的模型」。在弱威胁模型下(如 prompt injection、无意的错误行为),这或许勉强可行。

但代价是:你必须选择信任模型本身——而这一前提恰恰最难保证。结合他此前的观点,他认为 agent 边界内的数据流监控问题目前没有好答案。

所属事件:密码学家 Green:沙箱非万能,Agent 跨界数据流监控才是无解难题(6 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →