SEAD框架:工具调用智能体攻防DART攻击成功率最高提升35.9点
Xinjie Shen · hf · 2026-09-30
SEAD 将工具调用智能体的攻击与防御形式化为部分可观测的状态控制问题:早前操作可能改变文件、权限或数据库状态,使后续看似常规的操作产生危害,而可见交互无法揭示评估所需的状态信息。
- 攻击侧 DART:将有害目标分解为局部看似合理的步骤,并利用真实工具执行反馈引导轨迹搜索。
- 防御侧 SAGE:在放行或拦截每个动作前,通过只读查询调查相关状态,包括被拦截后新提议的动作。
- 数据集:整合可控初始状态、可重放工具环境与任务级可执行检查,支持环境自动验证。
- 结果:在四个目标模型上,DART 语义攻击成功率较基线提升 18.8–35.9 个百分点;SAGE 保留 95.79% 良性轨迹、拦截 92.73% 有害路径;在线攻防中将 DART 可执行攻击成功率从 48.0% 降至 4.0%,并跨四种攻击方法与域外环境保持有效。
代码与数据已开源:https://github.com/EverywhereSafety/SEAD
「编程与Agent」频道最新
- 推理再强数据不行也白搭:Agent 质量取决于信息源 — goyalshaliniuk · 2026-09-30
- Glasser 技能让 AI Agent 按需调用经核验的高质量数据 — goyalshaliniuk · 2026-09-30
- 免费书签脚本还原 Google 渲染后完整页面 — gaganghotra_ · 2026-09-30
- Dharmamitra Emacs 包更新版已上架 MELPA — SebastianNehrd2 · 2026-09-30
- mitsuhiko 讽刺开放标准现状:理想很开放,现实很骨感 — mitsuhiko · 2026-09-30
- DHH:AI 生成代码丑到爆没关系,它只是 prompt 编译产物 — mitsuhiko · 2026-09-30