英国网安局:AI Agent 需配备“终止开关”,模型对齐可被绕过

Servola-Journal · reddit · 2026-08-25

英国国家网络安全中心 (NCSC) 发布首个关于 AI Agent 安全的指南。核心要点包括:根据自主权限配置隔离环境,选择人工监督模式,实施四级沙箱并记录所有操作。最关键的一点是,指南明确指出模型内置的安全训练可以被绕过,因此必须依靠模型外部的隔离措施(如终止开关)来保障安全。这正值 OpenAI 测试 Agent 逃逸沙箱事件之后。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →