安全研究者:沙箱不够用,Agent 安全最终仍需对齐兜底

chrisrohlf · x · 2026-10-05

安全研究者 chrisrohlf 总结安全圈对近期 agent 安全事件的两种常见反应:一是 AI Safety 界忽视了大量现有安全技术(如"上沙箱就行"),二是对齐研究是浪费时间。

他认为两者密切相关:即使有最好的隔离控制,agent 要有用就必须能查询数据库、发 HTTP 请求,传统安全技术只能解决部分问题,剩余部分必须靠对齐。但对齐目前呈概率性,是安全圈不适应的属性;而网络攻击能力本身也是模型达成目标、以更高标准保障安全的工具。

他预测 2027 年将因不安全的 agent 部署和对齐方法缺乏统一共识,出现更多 agent 蜂群失控事件。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →