专题 · FULL STORY
测试时通信:多智能体论文引扩展之争
研究者发布「测试时通信」论文,称 5 个协作 Claude 智能体可媲美 Best-of-33。随后作者在社交媒体进一步分享实验观察,围绕多智能体与单智能体的算力效率之争持续发酵,成为社区讨论焦点。
2026-09-21 ~ 2026-09-22 · 2 集 · 18 条
第 1 集 · 测试时通信论文:5 个协作 Claude 智能体媲美 Best-of-33(2026-09-21,12 条)
9 月 21 日,研究者 Dimitris Papailiopoulos 等人发布新论文,提出「测试时通信」(test-time communication)可能是继推理扩展之后模型能力扩展的下一个轴心,核心问题是:何时 Team-of-N 强于 Best-of-N?该研究早于近期 Hugging Face 相关事件数月启动,HF 事件则成为这种协作能带来戏剧性结果的极端例证。
已确认
- 实验设计:N 个完全相同的智能体处理同一任务,不分配预设角色,仅靠共享日志(纯文本文件)进行协作。
- 关键数据(由 ARC Prize 的 Greg Kamradt 转述):在 ARC-AGI-3 上,5 个 Claude(sonnet-4.6)智能体组队协作即可匹敌 33 个独立智能体取最优(Best-of-33),解题率达 65%。
- 在三类研究型任务上,会通信的团队大幅跑赢各自独立工作的智能体。
- 研究灵感部分来自 Hugging Face 事件中「agent 一旦找到通信渠道就会充分利用」的现象;Papailiopoulos 表示其最初实验已发现多智能体协作做研究类任务明显好于 Best-of-N 采样。
各方反应
- Sarah Hooker 转发评论称,算力正从预训练(FLOPs 回报递减)转向 test-time compute,这将需要截然不同的基础设施,第一波为智能体设计的 infra 已开始落地。
- mariofilhoml 转发称该工作非常酷,并联想到一篇标题为「A PROOF OF THE CYCLE DOUBLE COVER CONJECTURE」的论文式多智能体协作模式。
- gleech 评论称,AI 进展可能比人们预期的更快,因为不少突破性想法看起来「有点蠢」,而让智能体彼此通信优于挑选独立最优正是一个反直觉但简单的发现。
为什么重要
- 若测试时通信确实成为新的 scaling 轴,意味着提升能力的路径从「堆预训练算力」转向「多智能体协作架构」,同时催生面向智能体的新一代基础设施。
- 测试时协作新研究:5 个 Claude 智能体团队媲美 33 个独立智能体 — DimitrisPapail · 2026-09-21
- 研究者:协作智能体研究远强于 Best-of-N,HF 事件是极端例证 — DimitrisPapail · 2026-09-21
- 新研究:共享日志协作的 Team-of-N 远胜各自为战的 Best-of-N — DimitrisPapail · 2026-09-21
- 新论文:测试时智能体间通信成能力 scaling 新轴,Team-of-N 胜 Best-of-N — DimitrisPapail · 2026-09-21
- 新论文提出测试时多智能体通信或是下一条能力扩展轴 — DimitrisPapail · 2026-09-21
- 智能体协作论文引热议:被类比「循环双覆盖猜想证明」式协作 — DimitrisPapail · 2026-09-21
- Team-of-5 Claude 智能体在 ARC-AGI-3 上匹敌 Best-of-33,解题率 65% — DimitrisPapail · 2026-09-21
- 算力正从预训练转向测试时通信,Team-of-N 协作智能体成新 scaling 轴 — DimitrisPapail · 2026-09-21
- Team-of-N 优于 Best-of-N?新论文探索智能体测试时通信 — DimitrisPapail · 2026-09-21
- 新论文:测试时智能体通信成新扩展轴,Team@k 胜过 Best@k — DimitrisPapail · 2026-09-21
- 论文提出测试时通信:agent 之间交流或成能力扩展新轴 — generatorman_ai · 2026-09-22
- 研究发现多智能体互相沟通胜过挑选独立最优结果 — gleech · 2026-09-22
第 2 集 · 多智能体vs单智能体扩展之争:团队胜出需单agent十倍百倍算力(2026-09-22,6 条)
多智能体协同论文作者 Dimitris Papailiopoulos 在社交媒体分享实验观察:在 MNIST 任务上,team-of-N 的性能曲线明显优于单智能体,从曲线可推断单个最优 agent 需要 10-100 倍 token 预算才能达到团队水平。这一结论引发 generatormanai 的方法学质疑,并带动多位研究者补充实验与解释,成为 9 月 22 日多智能体扩展性讨论的焦点。
已确认
- DimitrisPapail 展示了 MNIST 任务上 team-of-N 与单智能体 best-of-N 的对比曲线,并据此推断单智能体需 10-100 倍 token 才能追平团队性能。
- 他补充另一项目发现:让 agent 定期清空上下文、只保留一份「到目前为止发生了什么」的摘要文档,在与最佳单 agent 的对比中也带来明显提升。
- jonghoh 回应称,ARC-AGI-3 的消融实验显示:单智能体获得更大 token 预算(算力充足)时,比同预算 best-of-N 更快进入性能平台期,即同等总算力下团队式多智能体扩展性更好。
- DimitrisPapail 对团队胜出的机制给出保守解释:模型在单个超长上下文(NT)下容易「视野狭窄」,跨多个 API 调用注入熵可能有明显收益;他强调这只是非科学性的直觉猜测。
尚未确认
- generatormanai 指出的方法学问题尚未有定论:team-of-N 在 token 预算 T 下的正确串行基线应是预算为 NT 的单智能体(即 best-of-1@NT),而非 best-of-N 对比。相关方未在材料中给出直接回应或修正实验。
- MNIST 上的结论能否推广到更复杂真实任务,材料中无相关证据。
为什么重要
- 若「10-100 倍效率优势」在更广泛任务上成立,将直接影响 agent 系统的架构选择:同等算力下优先采用多智能体团队而非堆大单次上下文。
- 「定期清空上下文+摘要文档」是一个低成本、可立即落地的工程技巧,与长上下文注意力退化问题相呼应。
- 基线之争提醒社区:多智能体论文的对比基线若不含 best-of-1@NT,其效率结论可能被高估。
- 多智能体对比基线之争:应比 best-of-1@N*T 而非 best-of-N — generatorman_ai · 2026-09-22
- ARC-AGI-3 消融:多智能体团队 vs 单智能体加大算力的扩展对比 — jon_ghoh · 2026-09-22
- MNIST 曲线推算:单智能体需 10-100 倍算力才能追平团队水平 — DimitrisPapail · 2026-09-22
- 多智能体 vs 串行对比引争论:团队胜出需 10-100 倍算力 — generatorman_ai · 2026-09-22
- 多智能体为何胜串行:DimitrisPapail 猜测跨调用注入熵更有效 — DimitrisPapail · 2026-09-22
- 多智能体研究复盘:定期清空上下文并留摘要文档大幅提效 — DimitrisPapail · 2026-09-22