受控研究发现,多智能体平均只比单 agent 高 0.0%
bravo_abad · x · 2026-07-28
一项受控实验发现:在固定提示词、工具权限和计算预算的前提下,给任务多加几个 AI agent,并不会带来稳定收益。
- 研究覆盖 260 种配置,比较了 5 类架构:单 agent、独立、多中心化、去中心化和混合式。
- 实验对象是 3 个模型家族、6 个代理型基准,任务从网页浏览到软件工程、命令行操作都有。
- 总体结果几乎是 零增益:相对单 agent 的平均提升为 0.0%,95% 置信区间为 -58.7% 到 +77.2%。
- 真正显著的是任务差异:金融分析在集中式编排下可提升 +80.8%,但其他任务也可能变差。
- 这篇论文的核心结论是:多智能体只有在单 agent 已经吃力时才可能有帮助,而且收益并不稳定。
「编程与Agent」频道最新
- Cursor 印度专属 Start 方案定价 649 卢比,加入 Grok 4.5 云端 Agent — PrajwalTomar_ · 2026-07-28
- Cursor 在印度推出 649 卢比方案,主打 Grok 4.5 云端 Agent — PrajwalTomar_ · 2026-07-28
- MCP 服务器开发者在问:真的有人会查安全性吗 — NotIdealBut · 2026-07-28
- 不可信 AI 代码沙箱几乎全守住了,DNS 却成了外泄通道 — Ok_Beyond_6313 · 2026-07-28
- Kimi K3 被接入 Claude Code 工作流当默认模型 — ngxson · 2026-07-28
- Cursor 将 Grok 4.5 和 Composer 2.5 打包进 ₹649 月费套餐 — CodeByPoonam · 2026-07-28