多智能体系统新研究:128 个 Agent 把难题通过率提升 49%
OfirPress · x · 2026-09-29
Agensh 研究在 ProgramBench 5 个最难任务上,用 GPT-5.6-sol(高推理档)+ Copilot 作为单 agent 底座,把 agent 数量从 1 扩展到 128,6 小时最终通过率从 19.31% 升至 28.78%,相对提升约 49%。Ofir Press 转评认为多智能体系统研究空间很大,值得探索的关键问题包括:agent 是否需要层级组织、应否预先指定组织方式还是让它们自主形成、是否一开始就分配角色等。
所属事件:微软发布无中心编排多智能体框架 Agensh(2 条相关)→
「编程与Agent」频道最新
- Sonnet 5.5 低推理档复刻开源编辑器 Proof,此前仅三款模型通过 — every · 2026-09-29
- 大规模 Agent 编码卡在构建测试,开发者自建 dsr 替代 GitHub Actions — doodlestein · 2026-09-29
- 云规划+本地编码实测:成本降 2.7 倍但耗时长 9 倍 — GapNew4766 · 2026-09-29
- 用 Claude 写 Python 选股:34 只股+格雷厄姆公式的自动化实验 — Elfwood86 · 2026-09-29
- Turbopuffer 联创证实 Cursor 弃用服务端 RAG,新模型下 grep 更好用 — ivan_bezdomny · 2026-09-29
- 用户与 Opus 两天协作开发 Skyfall Rush,网页游戏免费可玩 — TAbrodi · 2026-09-29