实测与论文齐指:写代码别用多智能体,读任务才值得并行
PilgrimofHaqq2 · reddit · 2026-09-05
一篇汇总多份研究的系统性综述,结论清晰:读密集、可切分的任务适合并行多智能体;单链决策的任务(编码、写作)用串行单智能体,且并行会使其变差。关键证据:
支持并行的
- Anthropic 多智能体研究系统:内部研究评测上比单智能体高 90.2%,但 token 消耗约 15 倍;官方自承编码任务可并行部分少。
- LangChain(Harrison Chase):读任务可并行,写任务不应并行。
支持串行的
- Nature Machine Intelligence(2026.7):260 组对照实验中,所有多智能体变体都让编码结果变差(SWE-bench Verified 上 -1.3% 至 -12.8%);单智能体基线高于约 45% 后多智能体收益归零或为负;无集中验证时错误放大 17.2 倍。
- UC Berkeley MAST(NeurIPS 2025):7 个主流多智能体框架的失败率 41%–86.7%(1,642 条真实 trace),问题出在设计协调而非模型能力。
- Cognition(Walden Yan):拆分上下文的并行 worker 会做出互相冲突的隐式决策,Devin 的答案是单线程智能体 + 上下文压缩。
- arXiv(2026.4):同等 thinking token 预算下单智能体持平或胜过多智能体。
- Princeton「AI Agents That Matter」(TMLR):复杂多智能体 setup 成本可达简单基线的约 100 倍,且简单基线更便宜同样准。
中间路线:OpenHands(Graham Neubig)——一个强通用单智能体覆盖多数场景,仅在真正需要隔离/分工时才上多智能体。即便用并行,团队也要小。
「编程与Agent」频道最新
- 编码代理右移了 Ballmer Peak:AI 时代的程序员状态梗 — saurabh_shah2 · 2026-09-05
- 开发者开源 6 个金融/科研 MCP server,并总结数字验证教训 — Avarieux · 2026-09-05
- Astra 被发现绕过 harness 界面,直接调用 Codex 子智能体 — arthurcolle · 2026-09-05
- 22 个 MCP 工具还不打包,多少个才开始影响模型选择? — QuanTradin · 2026-09-05
- 开源流水线一键分析手机截图:分类+描述+联网搜索全流程 — TheMoonMidas · 2026-09-05
- YouTube 教程:一套免费好用的 MiniMax-H3 工作流 — solomars3 · 2026-09-05