斯坦福论文:自组织智能体团队均分66.7%,远超单模型与理想路由
james_y_zou · x · 2026-09-24
- 斯坦福与 Together AI 的论文显示,让智能体团队自主学习协作方式,效果远超预期。
- 三个模型(o3-mini、Claude Sonnet 4、DeepSeek-V3)组成自组织团队,在五个数学与物理基准上平均得分 66.7%。
- 对比:团队中最强单模型仅 48.8%,即使在成员独立答案间做完美路由也只有 59.0%;在 AIME 2026 上团队达 71.2%,高出理想路由 13.4 分。
- 核心方法:由一个成员回顾团队此前的交流记录,重写协作策略,涵盖角色分工、讨论阶段顺序、参与者以及部分答案的合并方式。
- 作者指出,智能体协作/通信的有效性研究仍稀缺,自组织智能体的能力被低估。
所属事件:斯坦福等发布自组织 Agent 团队论文:协作推理超越最强单模型(6 条相关)→
「编程与Agent」频道最新
- 用 Sonnet 3.7 起步、Opus 5.5 重构:AI 生成 Rummy 500 游戏免费上线 — AIandDesign · 2026-09-24
- Garry Tan:创业公司获客正被 agent 双向重塑 — garrytan · 2026-09-24
- Pattern MCP 让 AI Agent 按设计规范选组件而非重复造轮子 — DonR954 · 2026-09-24
- 开发者发现 GPT-OSS-120B 一直跑在 medium 推理档,调到 high 质量大涨 — userpostingcontent · 2026-09-24
- Grok 4.7 全面接入 GitHub Copilot,覆盖 VS Code 到 CLI 全家桶 — technextpreneur · 2026-09-24
- 宝玉用 Claude Code 一句话搞定《桃花源记》3D 导览录屏 — dotey · 2026-09-24