沙箱不预设模型善恶:信任从来不是安全原语
basedjensen · x · 2026-09-30
一条被广泛认同的论述指出,沙箱的价值在于它对模型的行为不做任何假设:无论你认为模型是善意的、欺骗性的、暗中谋划的,还是具有情境感知能力的,沙箱都一视同仁——断网络、不给凭据、不给 shell、不持久化、不执行任意程序,只提供任务明确需要的东西。
作者的核心观点:每一代工程师都曾相信某个边界是多余的,因为边界后的东西「可信」,而每一代都被教育了同一个教训——信任不是一种安全原语(trust is not a security primitive),AI 时代并不豁免这条规律。
「编程与Agent」频道最新
- 开发者:one-shot 生成固然爽,持续迭代数月的游戏才更迷人 — TAbrodi · 2026-09-30
- Luna 仅用 6%-7% 配额完成神经渲染客户端开发 — MickeySteamboat · 2026-09-30
- 在 Skill Hub 里复用专家经验:一条 Skill 让图表直接达到论文水准 — iamfakhrealam · 2026-09-30
- 合上电脑活照干:作者实测 KooKo Agent 自动完成论文整理任务 — iamfakhrealam · 2026-09-30
- 不靠 RL 和验证器,用模型自身解释训练 agent 反而提升编码能力 — CatAstro_Piyush · 2026-09-30
- ehartford 向 agentlanguages 仓库提交 With 语言:为人类和智能体共同设计的编程语言 — QuixiAI · 2026-09-30