新论文指出,安全智能体评测不能只看成功率
Paul Kassianik · hf · 2026-07-21
这篇论文认为,安全智能体评测不能只看成功率,还应同时衡量推理、工具调用、遥测查询和信息补全的成本。
作者在 Cybench 和 Splunk BOTS v1 上评估了进攻型与防守型安全智能体,并在固定成本下比较模型,而不是只看最佳结果。结论包括:
- 进攻型 CTF 任务 会随着测试时算力增加而提升,规模更大的开源权重模型可以在保持成本优势的同时逼近前沿闭源系统。
- 防守型 SOC 调查 并不会以相同方式随算力扩展;它更依赖规范的工具使用、遥测导航和有选择的信息补全,而不是单纯更大的推理预算。
- 作者主张用 cost-aware、SOC-native 的方式评测安全智能体,才能更真实判断它们在实际安全工作流中的可用性。
结果页面在 evals.frontier.security。
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22