Claude Code 通过 MCP 委派 4 家模型,并跑了 198 次隐藏测试
MeetStraight1899 · reddit · 2026-07-21
我做了一个 MCP server,让 Claude Code 可以把任务委派给 GPT-5.6、DeepSeek、GLM 和本地 Qwen,再用 198 次运行和隐藏测试集去对比它们与 Claude 自身的表现。
- 这个 server 只暴露两个工具:listmodels 和 delegatetask,但足以让任何支持 MCP 的 agent 做多模型分发。
- 路由包括:通过 Codex CLI 调用 GPT-5.6、通过 z.ai 的 coding plan 调用 GLM、通过 LM Studio 在局域网里调用本地 Qwen。
- 测试设计为 6 个任务站点 × 11 个模型 × 3 轮,并且 graders 在委派前就已写好。
- 结果显示:单轮结果会骗人,有些“完美表现”其实只是偶然;而某些弱点则在多轮里反复出现。
- 文中称 GPT-5.6 Codex 家族在全部技术站点上拿到 54/54 的满分记录。
核心结论是:作为编排器,Claude 能外包的任务比想象中多,但前提是你要用重复、隐藏测试来验证,而不是看一次跑通就下结论。
所属事件:多模型编程Agent实测:廉价模型败于知识陈旧(2 条相关)→
「编程与Agent」频道最新
- 现代 AI Agent 协议栈的 11 项实用地图 — TheTuringPost · 2026-07-27
- NVIDIA 称 Nemotron 3 Ultra 在 RTL 芯片设计任务上达 97.1% — NVIDIAAI · 2026-07-27
- 东京 Agent Forge 黑客松一天做出可上线 AI agents — DavidBennett__ · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一个 VS Code 扩展给 Alchemy 模板加上 Markdown 高亮 — samgoodwin89 · 2026-07-27