双模型交叉审查代码未必靠谱:实测拉低通过率

Particular_Luck80 · reddit · 2026-08-05

很多开发者开始使用一个 AI 智能体写代码、另一个进行审查的工作流,但最近的一篇论文表明,引入第二个模型并不等同于获得了独立的代码审查。

实验在 116 个中高难度的 LiveCodeBench 任务上进行,对比了单模型、同模型交叉和跨模型交叉审查。结果发现,模型组合的方向至关重要:Claude 审查 Codex 的草稿能将通过率从 71.6% 提升至 89.7%;但反过来用 Codex 审查 Claude 的草稿,却把通过率从 91.4% 拉低到了 82.8%。

作者指出,这证明模型多样性并不等于独立判断。在实际工程应用中,建议对每种“编写-审查”组合进行单独评估,保留审查者的修改差异,并在接受重写前强制执行测试,以免被虚假的信心误导。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →