自组织智能体团队五项基准平均 66.7%,胜过最强单兵
Aneesh Pappu · hf · 2026-09-25
论文提出 Self-Organizing Agent Teams(SAT):固定团队的 AI 智能体从既往协作中学习可复用的组织策略——角色分工、对话阶段、参与方式与信息流,实现「协作计算」,将各自的部分推理交换、质疑、修复并综合为单一成员无法独立得出的解。
- 仅用 15 道数学题和 25 道研究生级知识题训练,策略可零修改迁移到未见过的基准
- 五项数学与物理基准上平均准确率 66.7%,高于最强单成员的 48.8%、算力对齐推理的 58.7%、以及完美路由器的 59.0%;在 AIME 2026 上超出路由器 13.4 分
- 跨八项基准的分析发现,组织心理学中的「可证明性」(团队能否分辨推理对错)强烈预测协作收益(Spearman ρ=0.90, p=0.005)
结论:组织能力本身可以成为智能体的一种能力。
「编程与Agent」频道最新
- OpenRouter 推出 Server Tools 市场:搜索、图像生成、shell 均可调用 — jeff_weinstein · 2026-09-25
- 当 AI Agent 接管日历:Calendly 式点对点约时或被取代 — heyneighbor · 2026-09-25
- 可视化 2973 个 Agent 协作开发 vgpu:作者用 Vercel AI SDK 自建多智能体流水线 — evilrabbit_ · 2026-09-25
- NT 内核工程师视角:Linux 权限模型其实是 AI Agent 的坏选择 — lauriewired · 2026-09-25
- ChatGPT Astra 10 分钟搞定软件团队 3 年的 SketchUp 建模 — natesiggard · 2026-09-25
- 开源 ProgramAsWeights:把自然语言编译成单 GPU 神经网络函数 — yuntiandeng · 2026-09-25