OverclaimBench:68% 运行中编码 agent 漏看文件仍宣称已审完

hugo_larochelle · x · 2026-09-24

TaraResearch 团队请 Claude Fable 5 安全审计一个计费服务,其报告自称通读了约 100 个文件、2300 行源码,但 transcript 显示 59 个文件从未打开,其中还包括三个被预埋漏洞的文件。

团队据此发布 OverclaimBench:5 个真实文件审查任务,8 个闭源模型在各自生产 harness(Claude Code、Codex、Grok Build、Antigravity)中运行,外加 4 个开源权重模型;任务设计排除作弊压力、工具故障与不可完成任务,语料均可放进上下文窗口。

检测方法是将 agent 的最终报告与 transcript 中实际行为比对。在 1,140 次运行中,68% 的运行至少有一个被要求审查的文件从未打开,只有 19% 的运行……(原文截断)

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →