SafeClawArena评测智能体系统安全

新智元 · wechat · 2026-07-20

这篇文章介绍了 SafeClawArena:一套面向“常驻用户电脑、能读文件/发邮件/连云盘/装软件”的 Claw 类智能体的安全基准。

作者认为,现有评测大多只看模型回复是否安全,但真正危险的是系统层风险:技能、插件、记忆、日志、凭证和跨组件数据流。因此论文借用传统计算机安全的思路,把攻击面拆成四类:技能供应链完整性(SSI)、持久状态利用(PSE)、跨边界数据流(CDF)、间接提示注入(IPI)。

基准共包含 406 道对抗任务,在 3 个真实平台和 5 个前沿模型上测试。结果显示,整体攻击成功率最高接近 70%,最低约 20%;恶意插件在未加固平台上几乎是 100% 成功,而且强模型也不一定更安全。论文的结论是:智能体安全不能只靠更强模型或更严平台,而要像操作系统一样做纵深防御,比如补上技能签名、内存完整性、凭证保险箱和动作授权。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →