斯坦福论文:自组织 Agent 团队 3 模型协作 66.7%,碾压最强单模型
rohanpaul_ai · x · 2026-09-25
Stanford 与 Together AI 的论文提出自组织 Agent 团队(SAT),反驳流行的「辩论+投票」多智能体套路——投票大多只是在既有答案里挑一个,创造不出新解。
核心做法:
- 一个模型复盘团队过往对话,重写「团队剧本」:谁负责复核、谁唱反调、信息如何流动
- 仅用 15 道数学题 + 25 道研究生级知识题练习,学到的策略可原样迁移到未见过的 benchmark
结果:五个数学与物理 benchmark 上,3 模型团队平均准确率 66.7%,远超最强单模型的 48.8%、等算力推理的 58.7%,甚至超过对成员独立答案做完美路由的 59.0%;AIME 2026 上超完美路由 13.4 分——团队真的算出了任何成员都没有的正确答案。
所属事件:斯坦福论文:自组织Agent团队胜过最强单模型(3 条相关)→
「编程与Agent」频道最新
- 「谁有最没法合并的 AI 代码泥潭?」开发者公开征集名场面截图 — pvncher · 2026-09-25
- 开源工具 Wake:把散落本地的 Claude/Codex 会话聚合成一个可搜索窗口 — tom_doerr · 2026-09-25
- 开源轻量浏览器 curf:250KB 体积,专为 AI agent 可操控而生 — jasonkneen · 2026-09-25
- Reddit 征集 AI Agent 失控案例:无限重试、循环互甩、一夜烧光额度 — masterai01 · 2026-09-25
- Auto-Research Arena:6300 次运行中 AI 智能体独立重发现前沿 LLM 架构思路 — qixing_huang · 2026-09-25
- 2026 年用 AI 的分水岭:项目上下文数字化+用上 Agentic 工具 — Afinetheorem · 2026-09-25