Team-of-5 Claude 智能体在 ARC-AGI-3 上匹敌 Best-of-33,解题率 65%
DimitrisPapail · x · 2026-09-21
ARC Prize 的 Greg Kamradt 转发 Dimitris Papail 等人的新论文并给出关键数据:在 ARC-AGI-3 上,5 个 sonnet-4.6 智能体组队协作即可匹敌 33 个独立智能体取最优(Best-of-33);其中一个游戏,单智能体尝试 64 次都未通过,协作团队通过率达 65%。
论文方法:N 个无角色分工的相同智能体只通过共享日志(一个文本文件)被要求「协作」,在多个研究型任务上,沟通团队大幅胜过独立智能体。作者据此提出 test-time communication 是能力扩展的下一个轴。
所属事件:新论文:测试时智能体通信成能力扩展新轴(13 条相关)→
「编程与Agent」频道最新
- 开源 Landing Page 设计 Skill:为 Claude Code 定制整套视觉系统 — GCWebDesigner · 2026-09-22
- Doe v. GitHub 案作出重要裁决,Copilot 输出侵权主张迎关键进展 — technollama · 2026-09-22
- claude-uds-bridge:让 Codex 和 Claude 原生互发消息 — LeonKohli · 2026-09-22
- shadcn+Mobbin MCP 组合,1-2 秒生成完整响应式界面 — msharmas · 2026-09-22
- Nat Friedman 承认 Muse 灵感来自 OpenClaw,曾买数百台 Mac mini — EdwardSun0909 · 2026-09-22
- SkillLift 用学习式评分替代真实 rollout,agent 技能进化省 40-70% token — dair_ai · 2026-09-22