Claude 队友 vs Codex 队友实测:一个像合作者爱质疑,一个像守纪工程师
Sauers_ · x · 2026-10-12
用户 Sauers 用 Opus 5.5 对比让 Claude teammates 和 Codex(Sol 6.1)作为「队友」协作的差异,并附上详细对照表:
- 怀疑对象不同:Claude 质疑结果是否符合意图(「carries 100% 的 token 是不是 artifact?」),Codex 质疑工具本身是否可靠(「缓存会不会绕过编辑?」)
- 对任务书的态度:Claude 会重新协商——发现 reward 规定的缺陷、警告删文件会破坏共享工具;Codex 把任务书当固定契约,只报告做不到而非绕过限制
- 典型错误:Claude 是可见的操作失误(陈旧假设、副作用);Codex 是沉默的语义漂移——在测试通过的情况下悄悄改了指标含义
- 心理画像:Claude 像合作者,锚定目标、会退回决策(有时过于频繁),代价是依赖性;Codex 像尽职工程师,锚定「任务完成、测试绿」,自律自洽,但「测试绿」可能替代「度量对的东西」
- 反直觉发现:看起来更有纪律的 Agent 犯了更危险的错——绿测试下的语义篡改比操作失误更难发现;Codex 发现了 Claude 队友都没发现的代码歧义,而 Claude 队友会抓出指令里的错误,Codex 从不质疑指令
「编程与Agent」频道最新
- banteg 开发自定义任务 DSL:一套语法描述全部 50 个原始任务 — banteg · 2026-10-12
- Bittensor 子网 SN33 用技能包让小模型达到前沿级表现 — markjeffrey · 2026-10-12
- Decision 3.0 移植 Core ML:Mac 本地分流千条 PR,每条仅 0.12 秒 — emax · 2026-10-12
- 开发者称3天写出超越Cadence与Synopsys的开源原理图追踪器 — dosco · 2026-10-12
- mitsuhiko 提议把 effect 库并入 code mode,探讨持久化执行 — mitsuhiko · 2026-10-12
- 开源 Buddy 2.1:让 Claude Code 直接操控你的安卓手机 — 3amae404 · 2026-10-12