Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?
Zuodong Xiang, Yike Zhang, YueMing Zhang, Hailu Xu
KDD'26
cs.SE, cs.AI
2026-07-23
在 116 道 LiveCodeBench 题上,让 Claude 审 Codex 草稿,通过率从 71.6% 抬到 89.7%;反过来让 Codex 审 Claude,从 91.4% 掉到 82.8%。
很多团队现在的 coding workflow 不止调一个模型:让一个 agent 写初稿,再让另一个 agent 像 code review 一样过一遍,确认没问题才合并。直觉上,第二个模型带着不同的知识和视角,总能补上第一个漏掉的。但第二遍调用要花更多 token、更多时间,也可能把一份能跑的代码改坏。这篇 KDD'26 workshop 论文要回答的问题很直接:这种「双模型交叉审查」到底值不值,以及更关键的,谁写、谁审,顺序有没有影响。
实验设计干净。任务集是 LiveCodeBench 里 116 道 hard 和 medium 难度的竞赛编程题(单文件 Python,带隐藏测试),题目都是 2025 年后发布的,落在 Claude Opus 4.7 和 Codex GPT-5.5 的训练截止之后,排除模型靠记忆作弊的可能。
六种条件覆盖了「谁写 × 谁审」的全部组合:
关键约束是「静态审查」:审查者能看到题目和初稿,但不能跑代码、不能看测试结果、不能看执行 trace,模拟开发者在 CI 之前人工 review 的那一步。所有条件统一用 high reasoning effort、统一 prompt、统一 <solution> 输出格式,这样最后比出来的差异只能归到审查这一步本身。统计用配对的 McNemar 检验加 BH 校正。
结论是对称性破缺,谁审谁差别巨大。
| 条件 | 通过率 | 相对单写基线 | 每题成本 | 回归率 |
| A(Claude 单写) | 91.4% | 基线 | $0.226 | 基线 |
| O(Codex 单写) | 71.6% | 基线 | $0.190 | 基线 |
| OA(Codex 写,Claude 审) | 89.7% | +18.1 pp | $0.443 | 4.3% |
| OO(Codex 自审) | 84.5% | +12.9 pp | $0.312 | 5.2% |
| AO(Claude 写,Codex 审) | 82.8% | −8.6 pp | $0.382 | 11.2% |
| AA(Claude 自审) | 91.4% | +0.0 pp | $0.389 | 2.6% |
Codex 单写只有 71.6%;同一批草稿交给 Claude 审,跳到 89.7%(BH 校正后 p=.001),离 Claude 单写的 91.4% 只差两个题。Codex 自审也能到 84.5%(p=.022)。反方向完全不划算:Claude 的草稿交给 Codex 审,通过率从 91.4% 掉到 82.8%(p=.046);Claude 自审则原地不动,91.4% 一个点没变。
把「改对」和「改坏」拆开看(Figure 1),对称性更刺眼:OA 修好 26 个、改坏 5 个(净 +21);AO 只修好 3 个、却改坏 13 个(净 −10)。作者人工翻了一批案例,发现两个模型插手的方式不同:Claude 当审查者倾向保留初稿的接口、只修一个局部不变量(比如修好 segment-tree 的状态);Codex 当审查者一不确定就推翻原作者的数据结构重写(比如把一份能跑的有序链表中位数窗口换成 heap,结果反而挂了隐藏测试)。
对在用 coding agent 的团队,这是条能直接照搬的结论。如果手上的 writer 是 Codex,加一道 Claude 审查值得,每个净修复大约 1.40 美元(每题多花 0.25 美元,116 题净增 21 个通过);如果 writer 已经是 Claude,审查这步可以省掉,自审花钱花时间换不来任何提升,让 Codex 来审反而掉点。论文还给出一条更省的路径:延迟预算紧、能接受 84.5% 时,Codex 自审(OO)比跨模型更快更便宜。
机制上的判断更通用。审查的价值受限于审查者相对于写者的能力差:强模型审弱模型有空间补,弱模型审强模型往往只能帮倒忙。这和 Olausson 等人之前在 self-repair 上得到的结论对得上,修复有没有用,取决于修复者是否比起草者更强。延迟也指向同一个解释:Claude 单写要 86.2 秒,Codex 只要 38.5 秒,说明 Claude 在第一遍就把大量静态能查的错查掉了,第二遍能挖的所剩无几,自审自然没东西可补。
作者把边界画得很清楚。样本只有 116 道题,定位是探索性诊断,不是给模型排座次;只测了一对模型(Claude Opus 4.7 × Codex GPT-5.5),这套不对称能不能推广到 Gemini、DeepSeek、Qwen、Grok 没验证。静态审查不让跑测试,大概率低估了带沙箱、能调工具的 agent 能做到的修复;题目都是单文件 Python,不涉及仓库级修 bug、构建系统或多文件 review。
读完还有两点存疑。第一,作者承认无法把「审查方向」的效应和「两个模型基线差距」的效应完全分开,所以「顺序」这个结论只能当描述性的角色分配建议,不是对方向本身的因果断言;直接对比 AO 和 OA 的 McNemar 检验也没通过 BH 校正(p=.144)。第二,「Claude 倾向修局部、Codex 倾向重写」这套模式,作者自己也说是跨样本的解读性归纳,没量化重写频率,重复跑未必复现。