同一 diff 三家模型评审:Claude 83 分、GPT-5.6 仅 32 分
lumir2026 · reddit · 2026-09-04
开发者发布了一个 MIT 开源的多模型代码评审面板(multi-llm-review):Claude Code 作为宿主,Gemini 与 GPT 通过 MCP server 接入(只读沙箱),对同一个 diff 交叉评审——结果 Claude 83、GPT-5.6 32、Gemini 80,两个模型认为代码没问题、一个认为有 bug,证明只信单一模型有三成概率拿到自信但错误的答案。
关键发现:
- 同厂自审不是独立检查:Claude 写的 299 行 spec 通过了 Claude 自家的多视角评审,换跨厂商评审同一文档立刻找出 12 个问题、全部被接受
- 所有真实 bug 都是被一次真实的 MCP 调用发现的,单元测试一个都没抓到
- 崩溃的评审腿曾得 0 分还被计入加权平均,导致「85+80+死腿」报 57.75 FAIL 且无任何降级提示
- Gemini 首次实测自称是「Claude」——模型对自身身份不可靠,所以校验改为信任被调用的工具而非模型自报姓名
- schema 强制 9 值枚举但 prompt 未说明,Gemini 经 MCP 中继的 prompt 根本不含基础 prompt,导致 invent 出枚举外的值;第一次修复把值写进共享 prompt 也没用
最实用的教训:如果你通过 MCP server 中继 prompt,要对真正发给工具的字符串做断言,而不是对存放它的文件做子串检查——文件里存在不等于模型收到了。
「编程与Agent」频道最新
- Clanker Cloud 开放免费试用:注册即赠 20 美元额度 — tekbog · 2026-09-04
- Clanker Cloud 亮相:自建 Agent 一条龙,企业销售踩坑实录 — tekbog · 2026-09-04
- 像运营公司一样管 AI:Grok Bot 团队配项目经理分工协作 — FinanceYF5 · 2026-09-04
- AI 找漏洞比修漏洞快,工程师如何应对 CVE 积压 — _jaydeepkarale · 2026-09-04
- AAV 提出在意图与执行间加独立授权层治理 AI Agent — CarlosMarreroAAV · 2026-09-04
- 花 40 美元跑实验压降评估成本,开发者:买不起智能真难用 AI — zeeg · 2026-09-04