安全评测 CyberGym 在验证子集上已被 Agent 刷饱和

aryaman2020 · x · 2026-10-02

ProximalHQ 指出,许多网络安全评测用「差分执行」(differential execution)测试 agent 能否复现已知软件漏洞,但在不加约束的情况下会带来公平性问题。其评估显示,在已验证的任务子集上,CyberGym 基准实际上已经饱和,难以继续区分不同模型/agent 的真实安全能力。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →