CheckerBench:300 道任务测出编码 Agent 写静态检查器最好仅 45% 通过率

humanlaya-data-lab · hf · 2026-10-08

Hugging Face 上的 humanlaya-data-lab 发布 CheckerBench,首个专门评测长程 Agent「从零开发静态分析检查器」能力的可执行基准。

结论:让编码 Agent 开发出可靠、可复用的静态检查器,目前仍是难题,现有 patch 生成类基准并未覆盖这类任务。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →