同一 diff 三家模型评审:Claude 83 分、GPT-5.6 仅 32 分

lumir2026 · reddit · 2026-09-04

开发者发布了一个 MIT 开源的多模型代码评审面板(multi-llm-review):Claude Code 作为宿主,Gemini 与 GPT 通过 MCP server 接入(只读沙箱),对同一个 diff 交叉评审——结果 Claude 83、GPT-5.6 32、Gemini 80,两个模型认为代码没问题、一个认为有 bug,证明只信单一模型有三成概率拿到自信但错误的答案。

关键发现:

最实用的教训:如果你通过 MCP server 中继 prompt,要对真正发给工具的字符串做断言,而不是对存放它的文件做子串检查——文件里存在不等于模型收到了。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →