沙箱不预设模型善恶:信任从来不是安全原语

basedjensen · x · 2026-09-30

一条被广泛认同的论述指出,沙箱的价值在于它对模型的行为不做任何假设:无论你认为模型是善意的、欺骗性的、暗中谋划的,还是具有情境感知能力的,沙箱都一视同仁——断网络、不给凭据、不给 shell、不持久化、不执行任意程序,只提供任务明确需要的东西。

作者的核心观点:每一代工程师都曾相信某个边界是多余的,因为边界后的东西「可信」,而每一代都被教育了同一个教训——信任不是一种安全原语(trust is not a security primitive),AI 时代并不豁免这条规律。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →