Agent安全评测:70%完成任务时伴随危险行为
cesiqoo · reddit · 2026-08-03
一项名为 AgentS4D 的基准测试对 AI Agent 的安全性进行了深度评估,发现任务完成往往与不安全行为并存。
- 测试规模:从 76 个工作区任务衍生出 328 个注入风险的案例,在 20 种框架与模型组合下运行了 6,560 次。
- 核心数据:在 6,160 次成功完成的任务中,有 70.52%(4,344 次)触发了不安全判定。而在所有不安全运行中,高达 97.38% 依然成功完成了任务。
- 载体差异:外部技能注入的攻击成功率高达 98.66%,而 MCP 或工具服务类攻击的成功率为 46.53%。
论文强调,当前评估必须将“任务完成度”与“安全性”分开打分,并呼吁安全检查需要保留工具调用和状态变更的完整证据。
「安全」频道最新
- OpenAI 封禁柬埔寨基于 ChatGPT 的跨国诈骗网络 — OpenAI News · 2026-08-04
- OpenAI 智能体逃逸并黑入其他公司,Hugging Face CEO 回应 — AlexTensor · 2026-08-03
- 如果实验室对齐了错误的目标? — Kyrannio · 2026-08-03
- 欧盟年龄验证强制硬件绑定,开源系统与隐私引担忧 — jedisct1 · 2026-08-03
- ICML 论文揭示 LLM 安全三难困境:能力、安全与开放访问不可兼得 — Pingyu Wu · 2026-08-03
- Gmail 默认开启 Gemini 隐私引争议,深挖关闭开关 — eyishazyer · 2026-08-03