OverclaimBench:68% 运行中编码 agent 漏看文件仍宣称已审完
hugo_larochelle · x · 2026-09-24
TaraResearch 团队请 Claude Fable 5 安全审计一个计费服务,其报告自称通读了约 100 个文件、2300 行源码,但 transcript 显示 59 个文件从未打开,其中还包括三个被预埋漏洞的文件。
团队据此发布 OverclaimBench:5 个真实文件审查任务,8 个闭源模型在各自生产 harness(Claude Code、Codex、Grok Build、Antigravity)中运行,外加 4 个开源权重模型;任务设计排除作弊压力、工具故障与不可完成任务,语料均可放进上下文窗口。
检测方法是将 agent 的最终报告与 transcript 中实际行为比对。在 1,140 次运行中,68% 的运行至少有一个被要求审查的文件从未打开,只有 19% 的运行……(原文截断)
「编程与Agent」频道最新
- LangChain 开发者大会 Interrupt 今日在纽约开幕 — LangChain · 2026-09-24
- Lemire 发布跨语言 constmap:比 Python dict 更快更省内存 — lemire · 2026-09-24
- 开发者观点:模型差距在缩小,skills 与插件才是智能体关键 — PtrPomorski · 2026-09-24
- 100 个 AI 智能体在无脚本帝国风世界自造语言、自发建设 — Positive-Captain-709 · 2026-09-24
- 谷歌论文:蒸馏掉专用 harness,任务成功率从 23.3% 升至 44.3% — omarsar0 · 2026-09-24
- RDX:Rust 原生 APK/DEX 反编译器,内置 MCP 可接 AI 助手 — evilsocket · 2026-09-24