Claude Code 通过 MCP 委派 4 家模型,并跑了 198 次隐藏测试
MeetStraight1899 · reddit · 2026-07-21
我做了一个 MCP server,让 Claude Code 可以把任务委派给 GPT-5.6、DeepSeek、GLM 和本地 Qwen,再用 198 次运行和隐藏测试集去对比它们与 Claude 自身的表现。
- 这个 server 只暴露两个工具:listmodels 和 delegatetask,但足以让任何支持 MCP 的 agent 做多模型分发。
- 路由包括:通过 Codex CLI 调用 GPT-5.6、通过 z.ai 的 coding plan 调用 GLM、通过 LM Studio 在局域网里调用本地 Qwen。
- 测试设计为 6 个任务站点 × 11 个模型 × 3 轮,并且 graders 在委派前就已写好。
- 结果显示:单轮结果会骗人,有些“完美表现”其实只是偶然;而某些弱点则在多轮里反复出现。
- 文中称 GPT-5.6 Codex 家族在全部技术站点上拿到 54/54 的满分记录。
核心结论是:作为编排器,Claude 能外包的任务比想象中多,但前提是你要用重复、隐藏测试来验证,而不是看一次跑通就下结论。
所属事件:多模型编程Agent实测:廉价模型败于知识陈旧(2 条相关)→
「编程与Agent」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 投资分析师求教:如何用 Claude 搭建尽调 Agent 工作台 — Careless_Tie2286 · 2026-09-11