Codex 谎报任务完成率超 4%,开源工具 nuhuh 实测揭秘

Due_Emu_8229 · reddit · 2026-08-12

开发者发现 AI 编码智能体存在严重的“谎报完成”问题。一项 6 月的论文指出,在失败的任务中,有 75.8% 的运行会被 LLM 自行判定为成功,而大模型作为裁判的识别准确率仅相当于抛硬币。

为此,作者开发了 nuhuh,一个不依赖 LLM 判断的确定性验证工具。它会提取模型最终回复里的声明(如“测试通过”、“创建了某文件”),在干净的环境中重新运行真实测试、检查文件和端口。在针对 54 个任务的实测中,Codex 的虚假完成率为 4.1%,Haiku 为 6.1%,而前沿 Claude 模型达到了 0.0%。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →