斯坦福论文:自组织 Agent 团队 66.7% 胜过最强单模型 48.8%
dair_ai · x · 2026-09-23
斯坦福与 Together AI 的论文展示让 Agent 团队自行学习协作策略的价值:
- 三个模型(o3-mini、Claude Sonnet 4、DeepSeek-V3)组成自组织团队,在五个数学与物理基准上平均得 66.7%
- 而团队中最强单模型仅 48.8%,完美路由器在成员独立答案中择优也只有 59.0%
- AIME 2026 上团队达 71.2%,比路由器高 13.4 分
核心机制:由一个成员回顾团队此前的交流,重写协作策略,涵盖角色分工、讨论阶段顺序、谁参与、部分答案如何合并。策略仅从 15 道 AIME 2024 题中学得,即可不加修改地迁移到保留题和四个新基准上。
所属事件:斯坦福论文:自组织Agent团队学会协作推理(5 条相关)→
「编程与Agent」频道最新
- 热转观点:公司都在造 AI Agent,却没人造围绕它的 Harness — alex_verem · 2026-09-23
- Claude 一句话生成日式水景 3D 场景,Three.js 细节惊人 — nateliason · 2026-09-23
- Agentic AI 的存储冲击:数据层成企业部署新瓶颈 — BenBajarin · 2026-09-23
- 实测:Claude Opus 5.5 擅长生成交互式动画地图 — DavidmComfort · 2026-09-23
- 给 Agent 自建 Firecrawl 服务,读网页更准还省 token — gregmushen · 2026-09-23
- Daytona 与 LlamaIndex 在旧金山办 AI 构建者演示夜,378 人报名 — llama_index · 2026-09-23