新论文指出,安全智能体评测不能只看成功率

Paul Kassianik · hf · 2026-07-21

这篇论文认为,安全智能体评测不能只看成功率,还应同时衡量推理、工具调用、遥测查询和信息补全的成本。

作者在 Cybench 和 Splunk BOTS v1 上评估了进攻型与防守型安全智能体,并在固定成本下比较模型,而不是只看最佳结果。结论包括:

结果页面在 evals.frontier.security。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →