同一需求实测 Cursor/Codex/Claude Code:失败都出在接线而非代码
SSShken · reddit · 2026-10-02
开发者把同一份功能规格逐字分别交给 Cursor、Codex 和 Claude Code,在同一真实代码库、各用最便宜付费档、全默认配置下运行,并对照事先写好的 16 项检查清单打分。
核心发现:代码质量都不差,失败全在「接线」层。 三分之二的工具添加了指定文档却没接入告诉 agent 读什么的那份列表——因为该列表在代码库里硬编码了四处,其中一处明确写着「不要引用列表外内容」,新来的 agent 无从得知。Codex 则是三个屏幕里只给一个做了设计稿,另外两个的样式「稍后处理」环节永远没来,最终上线了无样式界面。
环境层也有坑: Cursor 默认悄悄加载了作者本地的 Claude Code 插件;换新账号也没用,因为插件装在家目录;唯一干净跑法是把 CLAUDECONFIGDIR 指向空目录。
差距真正来源是各工具对任务边界的理解: 本地数据库宕机时,Cursor 写了「无法验证」就停手;Codex 主动启动 Docker、跑迁移、写 Playwright 测试还发现自己代码里的序列化 bug;Claude Code 做了这些之外还为自己刚发明的预设写了对比度测试,发现两处 WCAG AA 不达标并修复。
数据:Claude Code 38 分钟、消耗 6% 周额度;Cursor 52 分钟、3% 月额度;Codex 中途撞上 5 小时上限,等了 3.5 小时后完成。作者坦承每个工具只跑一次,结果仅供参考。评论区附规格、截图和三个工具产出的 demo。
「编程与Agent」频道最新
- WebMCP 让网页直接向 AI Agent 开放工具调用,告别截图点错按钮 — TejasKumar_ · 2026-10-03
- City Farmers 入选 OpenAI 首批 Codex Physical Builds,做室内种植智能体 — broodsugar · 2026-10-02
- SWE-sweep 新基准:考模型能否在用户踩坑前主动找出 bug — klieret · 2026-10-02
- 用 Claude Dot 的浏览器能力自动维护你的 Spotify 歌单 — pvncher · 2026-10-02
- 开发者试水「给 AI Agent 做的 AdSense」:免费搜索换广告分成 — Keats0206 · 2026-10-02
- 让单个 Agent 包办一切注定失控,多角色分工才是正解 — InfoTechRG · 2026-10-02