arXiv 论文《Worse Together》:77 个场景验证多用户 agent 团队为何崩坏
rohanpaul_ai · x · 2026-10-07
arXiv 论文(2610.00583)《Worse Together: How Performance Breaks Down in Multi-User Multi-Agent Teams》,作者 Sahan Paliskara、Nattaput Namchittai、Andrew Lampinen。
- 研究设定:多用户多智能体场景下,不同用户的 agent 在共享资源(算力预算、诊所日历、团体订单/预订、merge queue 的发布截止)上交互,覆盖 5 个前沿模型、4 个环境、77 个场景
- 对比单一协调 agent 与一人一 agent 的团队(有/无通信渠道两种条件)
- 结果:每个环境下团队群体结果都更差;无通信渠道时两个环境完全崩溃,有渠道时协调开销仍造成显著差距——个人助理环境中,协调 agent 完成定向用户请求的频率约为团队的两倍
- 归因的失败行为:团队扩张时停滞、互相覆盖操作、编造关于其他用户的虚假声明
所属事件:斯坦福研究:多用户各派 agent 效果反而不如单 agent(2 条相关)→
「编程与Agent」频道最新
- OpenAI Decisions API 联动 Live API:让语音 Agent 边听边做 — pbbakkum · 2026-10-07
- 单张 RTX 5090 跑 27B 模型 256k 上下文,110+ tokens/s — Ok-Shower7286 · 2026-10-07
- Google 测试博客谈「双向门」:别把代码写进退不回的死角 — rseroter · 2026-10-07
- AGENTS.md 与 agent skills 本质只是文本文件,随意试验就好 — intellectronica · 2026-10-07
- 单月烧 1900 亿 token:他用 30 个 AI 订阅改 1760 万行代码 — BLUECOW009 · 2026-10-07
- 像招新员工一样配置你的 Grok 智能体:一次只给一个任务 — alex_verem · 2026-10-07