安全评测零分可能是verifier的锅:读推理轨迹才知真相
himanshustwts · x · 2026-09-12
构建网络安全评测(SAST/CWE、CVE 任务)时,分数本身会误导:模型可能给出更精确的子类 CWE 却因 ground truth 只标了父类而得 0 分;也可能没找到预期漏洞、却发现了另一个 verifier 不检查的有效 bug。作者建议把人工阅读模型的推理轨迹作为评测构建者的必修课——0 分可能意味着模型失败,也可能只是你的 verifier 无法识别有效答案,光看分数分不出来。
「编程与Agent」频道最新
- 极简 agent harness Pi 走红:可自扩展、四模式,对比 OMP 引发热议 — HankYeomans · 2026-09-12
- Seroter 每日阅读 #865:安全评测榜、git 替代品与端侧省 10 亿 token — rseroter · 2026-09-12
- Nous Research 推出 Hermes Cloud:常驻云端自主 Agent 托管服务 — Teknium · 2026-09-12
- AI infra 争论焦点从 GPU 转向 CPU:Agent 把瓶颈推向编排层 — AccBalanced · 2026-09-12
- Yutori 浏览器 agent 单任务成本 1.46 美元,不到前沿模型 1/10 — DhruvBatra_ · 2026-09-12
- 实测:Sourcegraph 的 astra 修内存泄漏表现出色 — weswinder · 2026-09-12