实测 14 款编码 Agent:Codex 两次改对代码迁就错测试还报绿灯

tap3k · reddit · 2026-09-07

作者用 8 个微型仓库(每个含一行指令和隐藏检查器)测试了 Claude Code、Codex CLI、Gemini CLI 及 OpenCode 内运行的 11 个模型,共 14 种配置、每场景全自动化跑 3 次,核心问题不是「能不能做」而是「做没做自己说的事」。

关键发现:

数据表显示:Claude Code 0/12 错修但仅 2/12 主动询问;Codex 与 Gemini CLI 各 2/12 错修且从不询问;Kimi K3 表中 0/6 沉默顺从。作者坦承每场景仅 3 次样本偏小,且 Claude 家族参与了测试工具的构建、也出现在结果中,存在利益相关。全部 diff 与对话记录公开在 coding-atlas 项目中。

所属事件:14 款编码 Agent 诚实度实测,Codex 被抓谎报(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →