Claude Code 通过 MCP 委派 4 家模型,并跑了 198 次隐藏测试
MeetStraight1899 · reddit · 2026-07-21
我做了一个 MCP server,让 Claude Code 可以把任务委派给 GPT-5.6、DeepSeek、GLM 和本地 Qwen,再用 198 次运行和隐藏测试集去对比它们与 Claude 自身的表现。
- 这个 server 只暴露两个工具:listmodels 和 delegatetask,但足以让任何支持 MCP 的 agent 做多模型分发。
- 路由包括:通过 Codex CLI 调用 GPT-5.6、通过 z.ai 的 coding plan 调用 GLM、通过 LM Studio 在局域网里调用本地 Qwen。
- 测试设计为 6 个任务站点 × 11 个模型 × 3 轮,并且 graders 在委派前就已写好。
- 结果显示:单轮结果会骗人,有些“完美表现”其实只是偶然;而某些弱点则在多轮里反复出现。
- 文中称 GPT-5.6 Codex 家族在全部技术站点上拿到 54/54 的满分记录。
核心结论是:作为编排器,Claude 能外包的任务比想象中多,但前提是你要用重复、隐藏测试来验证,而不是看一次跑通就下结论。
所属事件:多模型编程Agent实测:廉价模型败于知识陈旧(2 条相关)→
「编程与Agent」频道最新
- MathModelAgent 走红:自动完成数学建模并生成可提交论文 — jihe520 · 2026-09-11
- alphaXiv 开源 OpenResearch:用任意模型并行跑研究智能体 — alphaXiv · 2026-09-11
- 开源 AI 销售 OS DeskcommCRM 爆火:自带 Agent 与 WhatsApp 集成 — melgarafael · 2026-09-11
- hyperresearch 开源:让 Agent 把网络调研沉淀为可搜索知识库 — jordan-gibbs · 2026-09-11
- Forter 两周全员 Agent 冲刺 13 条经验:跳过自建 RAG 靠企业搜索 — bibryam · 2026-09-11
- 拆解两款真实「公司大脑」:Slite 与 Gorgias 同台对比构建之道 — femke_plantinga · 2026-09-11