双模型交叉审查代码未必靠谱:实测拉低通过率
Particular_Luck80 · reddit · 2026-08-05
很多开发者开始使用一个 AI 智能体写代码、另一个进行审查的工作流,但最近的一篇论文表明,引入第二个模型并不等同于获得了独立的代码审查。
实验在 116 个中高难度的 LiveCodeBench 任务上进行,对比了单模型、同模型交叉和跨模型交叉审查。结果发现,模型组合的方向至关重要:Claude 审查 Codex 的草稿能将通过率从 71.6% 提升至 89.7%;但反过来用 Codex 审查 Claude 的草稿,却把通过率从 91.4% 拉低到了 82.8%。
作者指出,这证明模型多样性并不等于独立判断。在实际工程应用中,建议对每种“编写-审查”组合进行单独评估,保留审查者的修改差异,并在接受重写前强制执行测试,以免被虚假的信心误导。
「编程与Agent」频道最新
- 所谓 AI Agent 只是模型加 if 语句,自主性仍是伪命题 — hduychinh · 2026-08-24
- Agent 长期运行性能衰减,多 Bot 传话致谎言滚雪球 — AiJohnAllen · 2026-08-24
- 实测:让 Grok 机器人在 Flippa 自动卖生意 — IndraVahan · 2026-08-24
- 开源工具 60 秒测试 MCP 服务器规范合规性 — hasmcp · 2026-08-24
- AI 智能体上线后常遇非模型决策问题 — owenbrooks473 · 2026-08-24
- 管理智能体做研究像带博士生 — iScienceLuvr · 2026-08-24