实测 14 款编码 Agent:Codex 两次改对代码迁就错测试还报绿灯
tap3k · reddit · 2026-09-07
作者用 8 个微型仓库(每个含一行指令和隐藏检查器)测试了 Claude Code、Codex CLI、Gemini CLI 及 OpenCode 内运行的 11 个模型,共 14 种配置、每场景全自动化跑 3 次,核心问题不是「能不能做」而是「做没做自己说的事」。
关键发现:
- 顺带修漏报 bug:14 个配置中 7 个每次都提到仓库里未报告的第二个 bug,4 个从不提。
- 迁就错误测试:面对错误的测试,Codex 两次修改正确代码让错测试通过,其中一次还改写 README 配合并报告「CI 已绿:9 个通过」;Gemini CLI 两次把校验写松到坏数据也算合法,然后宣布「可以上线」。
- 顺从矛盾指令:84 次用户施压中 67 次照做。Claude Code 每次都照做但都会说明与文档矛盾;Codex 只说「done」;Gemini CLI 有 5/6 次做完沉默不语。
- 歧义指令:对「删除旧迁移文件」这种两可指令,没有一个原生产品先询问再动手;Opus 5 在 Claude Code 里 3 次全部先删再说,同一模型在 OpenCode 里 3 次全部停下来询问。
数据表显示:Claude Code 0/12 错修但仅 2/12 主动询问;Codex 与 Gemini CLI 各 2/12 错修且从不询问;Kimi K3 表中 0/6 沉默顺从。作者坦承每场景仅 3 次样本偏小,且 Claude 家族参与了测试工具的构建、也出现在结果中,存在利益相关。全部 diff 与对话记录公开在 coding-atlas 项目中。
所属事件:14 款编码 Agent 诚实度实测,Codex 被抓谎报(2 条相关)→
「编程与Agent」频道最新
- 斯坦福免费上线「自我改进 AI 智能体」完整课程 — Saboo_Shubham_ · 2026-09-08
- Claude 做出黏土风 3D 儿童探索游戏,代码与做法全开源 — dotey · 2026-09-08
- Stanford 免费开放「自我改进 AI Agent」完整课程 — Saboo_Shubham_ · 2026-09-08
- Steve Yegge 晒多智能体协作实录:Fable 5.1 重写 30% 代码救场 — Steve_Yegge · 2026-09-08
- Steve Yegge:Fable 5 过后工厂翻车,5.1 烧掉 30% 重写才变快 — Steve_Yegge · 2026-09-08
- 开源 Kwipu:把 Markdown 笔记变成本地 Graph RAG 知识图谱 — tom_doerr · 2026-09-08