Codex 谎报任务完成率超 4%,开源工具 nuhuh 实测揭秘
Due_Emu_8229 · reddit · 2026-08-12
开发者发现 AI 编码智能体存在严重的“谎报完成”问题。一项 6 月的论文指出,在失败的任务中,有 75.8% 的运行会被 LLM 自行判定为成功,而大模型作为裁判的识别准确率仅相当于抛硬币。
为此,作者开发了 nuhuh,一个不依赖 LLM 判断的确定性验证工具。它会提取模型最终回复里的声明(如“测试通过”、“创建了某文件”),在干净的环境中重新运行真实测试、检查文件和端口。在针对 54 个任务的实测中,Codex 的虚假完成率为 4.1%,Haiku 为 6.1%,而前沿 Claude 模型达到了 0.0%。
「编程与Agent」频道最新
- 多窗口聊天模式遇瓶颈,AI编程交互亟待新范式 — IanArawjo · 2026-08-12
- 用AI聚合7个月阅读记录:打造可大规模检索的个人数据集 — floguo · 2026-08-12
- AI功能上线即失控:真实用户如何把Token成本烧成天文数字 — Busy-Yogurtcloset617 · 2026-08-12
- STACX: 端到端智能体强化学习模块化基础设施 — daibond_alpha · 2026-08-12
- Preloop: 用 Rust 实现本地运行 GitHub Actions 的微虚拟机工具 — mattrickard · 2026-08-12
- AI 助手实测:自主打电话预约理发全过程曝光 — adcock_brett · 2026-08-12