AgentWorld 研究:多智能体协作任务成功率仅 12%
omarsar0 · x · 2026-10-02
omarsar(Elvis Saravia)转发介绍 AgentWorld 论文:让 3-20 个不同角色的 LLM agent 在游戏沙盒中协作完成 50+ 轮任务。核心发现是 agent 数量多不等于性能高——多智能体团队中真正有助于完成任务的动作不足三分之一,存在协调瓶颈和不必要的成本。
要点:
- Gemini 3 Flash 任务成功率最高,为 52.0%
- 协调类任务最难,成功率仅 12%
- 常见失败模式:沟通中断、角色混乱、共享计划丢失
- agent 无法看到彼此内部状态,只能通过消息和共享计划协调
「编程与Agent」频道最新
- LinkedIn 将 APM 项目改为 Associate Product Builder,AI 重塑产品团队编制 — aakashgupta · 2026-10-02
- Claude Skills、Code Mode、Codex 插件对比:超级 Agent 插件体系走向趋同 — op7418 · 2026-10-02
- Reddit 网友提醒:vLLM/llama.cpp 早已内置免费零样本分类器 — Altruistic_Heat_9531 · 2026-10-02
- 一次成型:开发者用 5.5 一句话生成拳击教练应用 — ZeroStateReflex · 2026-10-02
- 开发者用 Grok Bot、OpenAI Dot 拼出语音编排 Hermes agent 的助理系统 — alexcovo_eth · 2026-10-02
- 整本大书翻译成本几美分:DeepSeek 流水线一小时跑完 — teortaxesTex · 2026-10-02