CheckerBench:300 道任务测出编码 Agent 写静态检查器最好仅 45% 通过率
humanlaya-data-lab · hf · 2026-10-08
Hugging Face 上的 humanlaya-data-lab 发布 CheckerBench,首个专门评测长程 Agent「从零开发静态分析检查器」能力的可执行基准。
- 任务构成:300 个任务,源自 167 个仓库的 297 个 CVE,覆盖 85 种 CWE、5 种语言生态;每个任务含漏洞版与修复版代码、固定的分析环境和检查器脚手架。
- 评测框架:配套 CheckerLab,独立重建提交的检查器,衡量漏洞/修复诊断对比度、补丁定位、误报率与工具调用。
- 结果:21 个模型-框架配置、每配置 3 次独立重复,平均 Pass@1 仅 32.30%,最好的配置也只有 45.33%。
结论:让编码 Agent 开发出可靠、可复用的静态检查器,目前仍是难题,现有 patch 生成类基准并未覆盖这类任务。
「编程与Agent」频道最新
- LangChain 发布 Managed Deep Agents v0.9:智能体可自建定时任务 — LangChain · 2026-10-08
- Vercel AI SDK 周下载量突破 3000 万,一年内增六倍 — lgrammel · 2026-10-08
- GitHub HydraFusion 支持本地模型路由,微软推 3-bit 256K 版 MAI Code 1.1 — BenBajarin · 2026-10-08
- Devin Mobile 实机演示:云上 Agent 随时随地跑在 Linux/Mac/Windows — DevinAI · 2026-10-08
- 开源工具 GodTerm 把多个 Claude Code/Grok 账号聚合进一个终端 — Daniel_Farinax · 2026-10-08
- Jeffrey Emanuel 自制「say no to 流程仪式」agent skill,日均使用数百次 — doodlestein · 2026-10-08