SafeClawArena评测智能体系统安全
新智元 · wechat · 2026-07-20
这篇文章介绍了 SafeClawArena:一套面向“常驻用户电脑、能读文件/发邮件/连云盘/装软件”的 Claw 类智能体的安全基准。
作者认为,现有评测大多只看模型回复是否安全,但真正危险的是系统层风险:技能、插件、记忆、日志、凭证和跨组件数据流。因此论文借用传统计算机安全的思路,把攻击面拆成四类:技能供应链完整性(SSI)、持久状态利用(PSE)、跨边界数据流(CDF)、间接提示注入(IPI)。
基准共包含 406 道对抗任务,在 3 个真实平台和 5 个前沿模型上测试。结果显示,整体攻击成功率最高接近 70%,最低约 20%;恶意插件在未加固平台上几乎是 100% 成功,而且强模型也不一定更安全。论文的结论是:智能体安全不能只靠更强模型或更严平台,而要像操作系统一样做纵深防御,比如补上技能签名、内存完整性、凭证保险箱和动作授权。
「安全」频道最新
- Agent 运行中惊现伪造系统指令,疑似遭遇提示词注入攻击 — sandyyevans · 2026-07-22
- AI监管辩论:独立审计要求是否会扼杀初创企业? — ShakeelHashim · 2026-07-22
- 欧盟逼 Google 放开 Android AI 权限,Gemini 3.5 Pro 再度跳票 — Deep-Owl-1890 · 2026-07-22
- 智能体执行环境的安全基石:沙盒化宣言 — spirosoik · 2026-07-22
- PNAS 专题讨论版权、治理与 AI 法律系统 — chrmanning · 2026-07-22
- Pensar推出AI安全智能体:自动挖掘0day并完成修补 — andriy_mulyar · 2026-07-22