多智能体测试:模型快变控制平面稳
bingxu_ · x · 2026-07-10
这条转发介绍了 Meta 新模型 Muse Spark 1.1,以及团队在 SwarmOS 里做的大规模多智能体测试。
测试方式
他们给三个模型配置跑同一个“有歧义的市场判断”问题,三组配置分别是:
- GPT-5.6-Sol-max:44 个 agent,5.81 亿 token,约 5 小时
- GPT-5.6-Terra-xhigh:17 个 agent,3600 万 token,约 1 小时
- Muse Spark 1.1-xhigh:29 个 agent,4050 万 token,约 30 分钟
结果与结论
三组都得出了相同的有界结论。作者提炼的重点是:
- 控制平面才是更持久的资产:模型迭代会比企业系统更快
- 企业不应押注单一模型,而应在稳定接口之上维护受治理的模型组合
- 应按角色分配模型:更快的 worker、更强的证据审阅者、以及更保守的综合者
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11