Agent Arena 榜单发布:Claude Fable 5.1 居首

Agent Arena 发布基于真实长周期 agent 任务的动态排行榜,累计超 200 万会话、覆盖 44 个模型,评测模型调用网页、文件系统和终端工具的编排能力。Claude Fable 5.1 (Max) 以 +13.80% 净改进居首;GPT-6 Sol (Max) 基于 4000+ 真实用户会话以 +7.7% 升至第 6,成本仅竞品的 44%,刷新性价比前沿;成本-性能帕累托前沿显示 DeepSeek V4.1 单任务中位成本仅 6 美分,国产模型占据低价区间。

2026-09-25 ~ 2026-09-26 · 4 条相关