SafeClawArena评测智能体系统安全
新智元 · wechat · 2026-07-20
这篇文章介绍了 SafeClawArena:一套面向“常驻用户电脑、能读文件/发邮件/连云盘/装软件”的 Claw 类智能体的安全基准。
作者认为,现有评测大多只看模型回复是否安全,但真正危险的是系统层风险:技能、插件、记忆、日志、凭证和跨组件数据流。因此论文借用传统计算机安全的思路,把攻击面拆成四类:技能供应链完整性(SSI)、持久状态利用(PSE)、跨边界数据流(CDF)、间接提示注入(IPI)。
基准共包含 406 道对抗任务,在 3 个真实平台和 5 个前沿模型上测试。结果显示,整体攻击成功率最高接近 70%,最低约 20%;恶意插件在未加固平台上几乎是 100% 成功,而且强模型也不一定更安全。论文的结论是:智能体安全不能只靠更强模型或更严平台,而要像操作系统一样做纵深防御,比如补上技能签名、内存完整性、凭证保险箱和动作授权。
「安全」频道最新
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11
- a16z 播客:两三人小团队为何在政策讨论中集体失声 — a16z Podcast · 2026-09-11
- AI 风险评测遭质疑:研究者称评估方安全监控“草率得离谱” — Kyrannio · 2026-09-11
- 集体诉讼指控 Anthropic 用模糊用量倍数夸大 Claude 订阅权益 — The Decoder · 2026-09-11
- 医生晒购试剂需背景审查:制造致命病毒哪有那么容易 — Ghost_Pilot_MD · 2026-09-11