安全评测零分可能是verifier的锅:读推理轨迹才知真相

himanshustwts · x · 2026-09-12

构建网络安全评测(SAST/CWE、CVE 任务)时,分数本身会误导:模型可能给出更精确的子类 CWE 却因 ground truth 只标了父类而得 0 分;也可能没找到预期漏洞、却发现了另一个 verifier 不检查的有效 bug。作者建议把人工阅读模型的推理轨迹作为评测构建者的必修课——0 分可能意味着模型失败,也可能只是你的 verifier 无法识别有效答案,光看分数分不出来。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →