Agent Arena 榜单发布:Claude Fable 5.1 居首
Agent Arena 发布基于真实长周期 agent 任务的动态排行榜,累计超 200 万会话、覆盖 44 个模型,评测模型调用网页、文件系统和终端工具的编排能力。Claude Fable 5.1 (Max) 以 +13.80% 净改进居首;GPT-6 Sol (Max) 基于 4000+ 真实用户会话以 +7.7% 升至第 6,成本仅竞品的 44%,刷新性价比前沿;成本-性能帕累托前沿显示 DeepSeek V4.1 单任务中位成本仅 6 美分,国产模型占据低价区间。
2026-09-25 ~ 2026-09-26 · 4 条相关
- Agent Arena 榜单:Claude Fable 5.1 居首,200 万真实会话测 agent 能力 — arena · 2026-09-25
- Agent Arena 完整榜单:Claude Fable 5.1 居首,累计评测超200万会话 — arena · 2026-09-26
- GPT-6 Sol 登 Agent Arena 榜第6,成本仅竞品44%改写性价比前沿 — arena · 2026-09-26
- Agent Arena 帕累托前沿:DeepSeek V4.1 单任务6美分,国产模型霸占低价区间 — arena · 2026-09-26