测试时协作新研究:5 个 Claude 智能体团队媲美 33 个独立智能体
DimitrisPapail · x · 2026-09-21
Dimitris Papail 等人发布新论文,提出「测试时通信」可能是扩展能力的下一个维度,核心问题是:何时 Team-of-N 强于 Best-of-N?
实验设计:N 个相同智能体处理同一任务,无预设角色,仅靠共享日志(文本文件)并被告知「协作」。在三项「研究型」任务上,通信团队大幅胜过独立智能体:
- ARC-AGI-3:5 个 sonnet-4.6 智能体组队可匹敌 33 个独立智能体,某关卡单智能体 64 次尝试均失败,团队解出概率达 65%;
- 多联骨牌打包任务:团队同样显著领先。
作者引用 Hugging Face 事件指出:智能体一旦找到通信渠道就会充分使用它,值得研究通信何时让群体比个体之和更有能力。
所属事件:新研究:智能体共享日志协作远胜独立采样(4 条相关)→
「编程与Agent」频道最新
- OpenAI Agents API 开放公测:Codex harness 一次 API 调用即可用 — emmanuelvivier · 2026-09-21
- EvalSeal 开源:LLM 评测可信度回执,20 例边界判定 5 例翻车 — Fit_Fortune953 · 2026-09-21
- mcp-auth 开源:给 MCP 服务器接入现成企业身份体系 — BeautifulFeature3650 · 2026-09-21
- 开发者开源生产力向 MCP 服务器清单,按用例分类并接受社区 PR — Neither_Koala1678 · 2026-09-21
- 有开发者全程盯 agent 的工具调用与 diff 流 — BLUECOW009 · 2026-09-21
- 让 AI 给自己造硬件:Astra 自主设计出 USB 四灯 PCB — paraschopra · 2026-09-21