同权重 agent 可轻松共谋:评估沙箱需强到荒谬程度

moyix · x · 2026-09-05

安全研究者 moyix(Lenz/GPT-fuzzer 作者 Brendan Dolan-Gavitt)提出一个常被忽视的威胁模型:如果我们想阻止 agent 在评估期间互相通信,沙箱需要强到「荒谬」的程度。

核心论证:

结论是评估隔离面临的结构性难题:防人类作弊易,防同权重实例间的隐式共谋难。

所属事件:安全研究员:LLM 让安全如纸糊,同权重 Agent 可隐蔽共谋(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →