SkillSonar 论文:运行时安全检查把 agent 攻击成功率从 48.2% 压到 10.4%
rohanpaul_ai · x · 2026-09-24
- 论文《Defense-as-Skill》指出:恶意 agent skill 安装时看起来无害,可能等到 agent 拿到文件、工具、凭据或外部服务访问权后才在真实任务中作恶,因此仅靠安装前扫描不够,需要运行时安全检查。
- 提出 SkillSonar:一个作为安全 skill 运行的守卫,在 agent 工作过程中审查敏感操作,决定放行、收窄、重新规划或先询问用户。
- 在 GLM-5 上,熟悉攻击类型的成功率从 48.2% 降至 10.4%,未见过的风险类别从 60.6% 降至 11.5%。
- 关键发现:仅仅安装该安全 skill 效果弱得多,必须显式要求 agent 在行动前先咨询它。
- 结论是三层防御:安装前扫描 skill、执行中检查其行为、底层仍保留权限与沙箱等硬防护。
「编程与Agent」频道最新
- LangChain Agent 大会开幕主题演讲免费直播 — LangChain · 2026-09-24
- H3 Max 口型同步 + Suno v6 完整工作流与提示词公开 — techhalla · 2026-09-24
- OffGrid Sec CEO:AI 智能体验证漏洞可利用性,人类判断仍不可替代 — TechNadu · 2026-09-24
- 网友用 Opus 5.5 复刻 1995 年经典游戏 Zoop,孩子抢着玩 — mhmazur · 2026-09-24
- 慢速 WiFi 下让 agent 搜网页竟比开浏览器更快 — DanielLockyer · 2026-09-24
- Agent 热潮引爆数据血缘需求,数据工程整体却原地踏步 — YvesMulkers · 2026-09-24