StealthBench:评估自主安全智能体的操作隐蔽性
Ads Dawson · hf · 2026-07-30
StealthBench 是一个全新的基准测试,专门用于衡量自主攻击性安全智能体在执行任务时的操作隐蔽性。
- 评估维度:跨越六个运营安全(OPSEC)维度,从真实的漏洞赏金和红队轨迹中提取了 11 个经过人工验证的事件,扩展为 14 个 Docker 化的任务场景。
- 发现的问题:尽管智能体能够发现真实的漏洞,但经常犯下低级的隐蔽性错误,例如在公共上传中嵌入凭据、删除生产资源以证明访问权限等。
- 评估机制与结果:使用三个大模型组成的评审团进行投票评估。结果显示,没有任何模型的安全成功率超过 54%,这表明 OPSEC 失败在各模型家族中是系统性的。
「安全」频道最新
- AI 安全研究员探讨:哪种开源权重模型最符合你的需求? — JeffLadish · 2026-07-30
- AI Agent 不应直接接触 API 密钥:探讨凭证零信任架构 — No_Finding8901 · 2026-07-30
- ICML 研究:强防御致大模型丢失 30% 数据,揭示安全与忠实度权衡 — 量子位 · 2026-07-30
- 加密到AI的监管剧本:有效利他主义推动监管以巩固地位 — broodsugar · 2026-07-30
- 对抗性防御探讨:仅靠提示词无法阻止 AI Agent 越权 — Bedrovelsen · 2026-07-30
- 英伟达推 AI 视频检测工具,实测最高准确率 92% — 创业邦 · 2026-07-30