AgentWorld 基准:最强模型多智能体长程协作成功率仅 52%

Raphael Shu · hf · 2026-09-28

AgentWorld 是一个评测 LLM 多智能体长程协作能力的开源基准,揭示当前模型在协作上远未过关。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →