Claude Code 通过 MCP 委派 4 家模型,并跑了 198 次隐藏测试
MeetStraight1899 · reddit · 2026-07-21
我做了一个 MCP server,让 Claude Code 可以把任务委派给 GPT-5.6、DeepSeek、GLM 和本地 Qwen,再用 198 次运行和隐藏测试集去对比它们与 Claude 自身的表现。
- 这个 server 只暴露两个工具:listmodels 和 delegatetask,但足以让任何支持 MCP 的 agent 做多模型分发。
- 路由包括:通过 Codex CLI 调用 GPT-5.6、通过 z.ai 的 coding plan 调用 GLM、通过 LM Studio 在局域网里调用本地 Qwen。
- 测试设计为 6 个任务站点 × 11 个模型 × 3 轮,并且 graders 在委派前就已写好。
- 结果显示:单轮结果会骗人,有些“完美表现”其实只是偶然;而某些弱点则在多轮里反复出现。
- 文中称 GPT-5.6 Codex 家族在全部技术站点上拿到 54/54 的满分记录。
核心结论是:作为编排器,Claude 能外包的任务比想象中多,但前提是你要用重复、隐藏测试来验证,而不是看一次跑通就下结论。
「编程与Agent」频道最新
- 构建 AI Agent 安全网关:如何自托管多 SaaS 的 OAuth 集成 — Defiant_Cod_2654 · 2026-07-22
- Rowboat 作为开源本地优先 AI 同事上线 — ycombinator · 2026-07-22
- Reddit 用户串联 Ideogram 4 和 Krea2,复刻 bbox 定位效果 — v3lh0t05c0 · 2026-07-22
- Apollo 采用 Deep Agents 架构,AI 技能开发周期缩减 85% — LangChain · 2026-07-22
- Scoble 说 AI 的 loops 本质是长运行多智能体工作区 — Scobleizer · 2026-07-22
- Kimi Code 开放候补名单,Moonshot 推进编码产品 — Fabulous_Bonus_8981 · 2026-07-22