SAT 论文:自组织 Agent 团队数学基准平均 66.7%,胜过最强单体
zainhas · x · 2026-10-12
斯坦福等机构论文(arXiv:2609.22682)提出 Self-Organizing Agent Teams(SAT):固定的 AI agent 团队从既往协作中学习可复用策略,自行组织角色、对话阶段、参与方式与信息流,无需预先指定任务分解或路由。
核心发现
- 提出「协作计算」概念:agent 之间交换、质疑、修复并综合彼此的部分推理,得出任何单体都无法独立产出的解。
- 仅用 15 道数学题 + 25 道研究生级知识题训练团队策略,即可原样迁移到未见过的基准。
- 五个数理基准上平均准确率 66.7%:对比最强单体 48.8%、算力对齐的单体推理 58.7%、理想路由器 59.0%。
- AIME 2026 上超出理想路由器 13.4 个百分点。
- 论文进一步分析「何时自组织协作有效」,提出可演示性(demonstrability)等条件,增益在不同基准间有差异。
结论:团队的组织方式本身是一种可学习的能力,固定协议/显式分解/路由并非 agent 协作的唯一路径。
「编程与Agent」频道最新
- 20年想取代邮件,结果 Agent 把它当通用通信协议捡回来了 — signulll · 2026-10-12
- 实测 Gemini 审计爱彼手表页面 SEO:从标题到 JS 渲染逐项拆解 — gaganghotra_ · 2026-10-12
- Claude Code 分层工作流:Haiku 扫活、Sonnet 造码、Opus 把关 — Arindam_1729 · 2026-10-12
- 把每次纠错变成技能:用 Opus 5.5 搭会自我改进的 Agent 系统 — ramagetime · 2026-10-12
- 让 Claude 通宵写游戏,它回了一句「睡个好觉」 — prasenx · 2026-10-12
- 用自研 PDF 转换器+Codex,把西语微处理器教材译成英文互动版 — burkov · 2026-10-12