Scaling Discovery through Test-Time Communication
Jongho Park, Vasilis Kontonis, Shivam Garg, Akshay Krishnamurthy, Dimitris Papailiopoulos
cs.LG, cs.AI, cs.CL
2026-09-18
无角色相同智能体靠共享目录交换可验证突破。ARC-AGI-3 上 team@5 解出率 8.0% 顶 33 次独立采样;多面体装箱得分 0.945,MNIST 压到 1957 字节。
测试时算力的默认用法是并行采样 k 次,再取 majority 或 best@k。每条轨迹里的中间结果、失败实验、可复用产物,对旁边那条还在跑的轨迹是看不见的。多智能体该不该互相说话,先前证据是打架的。辩论常常打不过 chain-of-thought;没有 verifier 时,团队会向错误多数靠拢,或把专家判断稀释成折中。Anthropic 发现协作能挖出更多漏洞,但同等搜索范围内每个漏洞烧掉的 token 差不多。能干净拆成子任务的场景,并行本身就够了。没回答的问题是:任务拆不开时,通信能不能把并行探索变成累积进展。
UC Berkeley 与 Microsoft Research 的做法刻意做薄。k 个完全相同的 GitHub Copilot CLI agent,同一模型、同一指令、同一容器,没有角色、没有中心调度。每人有私有 scratch 目录,共用任务文件系统。通信走 append-only 日志,外加已采纳方案、反证和分数榜。唯一的协议级分配是 slot:用原子创建目录抢号,避免撞车。
协议强制两件事。先各自声明不同打法。有明显更好的分数才允许跟,跟了还得保留一个有意义的变体。论文把这个机制叫 verified progress sharing,可验证进度共享:谁先跨过一道可测的关,全组从那个状态接着搜,而不是每人从头走完整条轨迹。
对照是 team@k 对 best@k,人均资源对齐。任务三块:ARC-AGI-3 的 25 个公开游戏,Claude Sonnet 4.6,单智能体每游戏 64 次、团队 20 次;Frontier-CS 多面体装箱,Sonnet 与 Opus 4.6;MNIST 分类器压缩,门槛 99.4% 测试准确率,比 gzip-9 后的代码加权重,GPT-5.6 Sol 四人跑 96 小时。
ARC-AGI-3 上,Sonnet 4.6 单次全游戏成功率不到 1%。team@3 解出率 4.6%,best@3 只有 1.4%,要 13 个独立体才到 4.7%。team@5 到 8.0%,best@5 是 2.2%,要 33 个独立体才到 8.1%。倍率从 4.3× 涨到 6.6×。深度越大差距越大:k=5 时浅层 1.2×,通关 3.6×。
有些关独立体根本过不去。LP85 在 64 次单跑里 0 次通关,team@5 通关 65%。FT09 从单次 9.4%、best@3 的 25.9% 拉到 team@3 的 90%。team@5 通关过的 4 个游戏,平均解出率从 13.8% 到 50.0%。25 局里帮到 18 局、伤到 7 局;最大收益是 LP85 多走 4.30 关,最大损失不超过 0.85 关。
| 设置 | 全游戏解出率 | 对齐所需独立体 |
| best@3 | 1.4% | n/a |
| team@3 | 4.6% | 13 (4.3×) |
| best@5 | 2.2% | n/a |
| team@5 | 8.0% | 33 (6.6×) |
token 账不是白赚。team@3 / team@5 大约烧掉 800 万和 2400 万 output token,接近 best@k 的两倍。但要达到同等解出率,13 和 33 个独立体要花掉团队的 3.8× 和 4.9× token。人均不超过 40 万 output token 时,best@k 还领先,这是 coordination tax,协调税。每人只给原生预算的 0.2× 时,team@5 在 LP85 过完第 1 关、SB26 过完第 3 关后归零,输给花同样总预算的单体。每人给满预算时,team@5 在 SB26 通关 15%,best@5 大约 8%,5 倍预算的单体是 0;LP85 上 team@5 通关 65%,best@5 第 4 关就掉到 0。
官方 RHAE 里,最强成员从单体 3.8% 到 team@3 的 9.7%、team@5 的 13.6%,超过 best@3 的 7.0% 和 best@5 的 8.8%。team@5 的平均成员 8.9%,几乎等于 5 个独立体里最强的那个。
装箱任务上,先前最好是 Qu 等人 4 个 Opus 4.6 拿到的 0.894。Sonnet team@3 在官方 3 小时限额内打到 0.945,最强单跑 0.883,空隙从 11.7% 收到 5.5%。72 小时加长里,Opus team@4 到 0.922 对单体 0.893,Sonnet team@4 到 0.910 对 0.891。成功轨迹是接力:a1 提出接触最大化,自己实现太慢;a2 只看日志重写,再开全朝向搜索越过 0.90;a3 加上边界奖励,打到 0.945。
MNIST 压缩,人类参考 tinyMNIST 复现为 2461 字节、99.40%。best@4 停在 3160 字节,独立跑全部卡在大约 3–5KB,没人越过人类线。team@4 大约 20 小时后越过,最终 1957 字节、99.41%,比人类小 20.5%。前 1 小时和前 10 万 output token 团队是落后的。
Terminal-Bench 2.0 的 89 题上,team@2 均值 60.67%,过了 pass@1 的 52.53%,没过 pass@2 的 62.36%。官方 verifier 多数在跑完才给,中间反馈不一定能给方案排序。这里 team@2 还共享一个最终容器状态,pass@2 保留两个隔离结果。
这不是「多智能体一定更强」的广告,是一张条件表。任务拆不开、有可反复查询的分数或关卡信号、每人预算够自己先探索一轮,通信才能把并行变成累积。缺这几条,独立采样仍然更干净,还少一份协调税。
对做 agent 产品的人,含义很具体。best@k 在短任务、弱反馈场景仍然是默认。长 horizon 的算法搜索、压缩、带关卡的探索,共享工作区加分数榜可能比再开几路独立采样更划算。ARC 的增益集中在少数能通关的游戏上,25 局里大多数对 Sonnet 4.6 仍然够不着。但 LP85 这种单体 64 次零解、团队 65% 通关,说明通信有时能打开单体到不了的区域。
论文自己划了边界。低预算时协调税压过收益。没有可排序的中间信号,通信可能略差于 pass@k。固定一套共享工作区脚手架,同质 agent、无角色、无调度,不能外推到角色分工或异质模型。herding 会把 k 个 agent 收成 g 个重复搜索组,共享只在独立搜索还活着时有用。
实验本身有软肋。ARC 刻意用未饱和的 Sonnet 4.6,文中提到 GPT-6 Astra 已经能轻松打过这套基准,通信增益会不会随底座变强而缩,没测。装箱 72 小时只有 2 次 team@4,作者自己说 0.922 / 0.910 低于 3 小时的 0.945,很可能是试验次数太少。Terminal-Bench 只有一把量级的试验,他们当描述性证据,不当精确差距。多面体成功轨迹还借助 Opus 5 做事后分析,那部分是复盘不是对照实验。
反馈稀疏、有噪声、或主观时,通信还管不管用,论文明确列为未解。