同一需求实测 Cursor/Codex/Claude Code:失败都出在接线而非代码

SSShken · reddit · 2026-10-02

开发者把同一份功能规格逐字分别交给 Cursor、Codex 和 Claude Code,在同一真实代码库、各用最便宜付费档、全默认配置下运行,并对照事先写好的 16 项检查清单打分。

核心发现:代码质量都不差,失败全在「接线」层。 三分之二的工具添加了指定文档却没接入告诉 agent 读什么的那份列表——因为该列表在代码库里硬编码了四处,其中一处明确写着「不要引用列表外内容」,新来的 agent 无从得知。Codex 则是三个屏幕里只给一个做了设计稿,另外两个的样式「稍后处理」环节永远没来,最终上线了无样式界面。

环境层也有坑: Cursor 默认悄悄加载了作者本地的 Claude Code 插件;换新账号也没用,因为插件装在家目录;唯一干净跑法是把 CLAUDECONFIGDIR 指向空目录。

差距真正来源是各工具对任务边界的理解: 本地数据库宕机时,Cursor 写了「无法验证」就停手;Codex 主动启动 Docker、跑迁移、写 Playwright 测试还发现自己代码里的序列化 bug;Claude Code 做了这些之外还为自己刚发明的预设写了对比度测试,发现两处 WCAG AA 不达标并修复。

数据:Claude Code 38 分钟、消耗 6% 周额度;Cursor 52 分钟、3% 月额度;Codex 中途撞上 5 小时上限,等了 3.5 小时后完成。作者坦承每个工具只跑一次,结果仅供参考。评论区附规格、截图和三个工具产出的 demo。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →