伯克利新论文:协作智能体团队效果抵得上4倍独立智能体
DimitrisPapail · x · 2026-09-22
UC Berkeley 与 Microsoft Research 的论文《Scaling Discovery through Test-Time Communication》研究了多智能体在推理阶段的通信能否提升能力。
- 实验设置:N 个无角色分工的智能体在同一任务上工作,仅通过共享日志文件通信并被告知协作,基准为需要全新问题求解的 ARC-AGI-3。
- 核心发现:team@k(每步 k 个协作智能体)的成功率相当于 4k 个独立智能体,且该优势随 k 增大而扩大,说明收益随规模复利。
- 效果不止是效率:单个智能体无法解决的任务,协作团队可以稳定解决。
- 迁移到研究型任务:在 polyomino packing 上超过 best@k 并刷新已知最好成绩;在 MNIST 分类器压缩上,4 个协作智能体产出 1957 字节、99.4% 测试准确率的分类器,超过已知最佳人类方案和单智能体结果。
- 限制:算力受限或缺乏可靠的中间进度验证手段时,独立并行可能仍优于通信。
所属事件:测试时通信成新扩展轴,5 个协作智能体抵 33 个(20 条相关)→
「研究」频道最新
- 离线合成评分细则+多轮精修:一种缓解奖励黑客的做法 — stochasticchasm · 2026-09-22
- 前端设计被归为视觉 agent 任务,分组相对评分引关注 — stochasticchasm · 2026-09-22
- 传某团队拟开源 7000 个 RL 训练环境 — airesearch12 · 2026-09-22
- RL 从其他任务泛化,为何文学写作仍是最难的 AI 基准 — phl43 · 2026-09-22
- Simon Willison 评 Jev:输出浮点数的「决策模型」新物种 — Simon Willison · 2026-09-22
- 换个视角看策略梯度:score centering 无需重要性采样 — brandondamos · 2026-09-22