Arena 新榜单全景:Claude Fable 5.1 居 Agent 榜首,最低任务成本低至 $0.04
arena · x · 2026-09-25
Arena 改版后的 Leaderboard 页面展示了当前全景数据(累计 3.54 亿+会话):
- Agent 总榜:Claude Fable 5.1 (Max) 以 13.71% 居首,GPT 6 Astra (Max) 11.54% 次之,Claude Opus 5 (High) 10.25% 第三;Claude Opus 5.5 位列 WebDev·Max 榜第一
- 性价比前沿:Claude Fable 5.1 每任务 $4.17/13.71%;GPT 6 Astra $2.75/11.54%;Kimi K3 (Max) $0.68/6.22%;Deepseek V4.1 Flash (Max) 低至 $0.06/4.88%,Mimo V2.5 Pro 与 Hy3 低至 $0.04
- 实时会话流中可见 DeepSeek、Google Gemini 3.8、OpenAI GPT 5.6、SpaceXAI Grok 4.7、智谱 GLM 5.3 等模型的实际运行状态,也有匿名 Private Model 参评
- 新增 Model Capabilities 板块,由 Arena 团队撰写新模型第一印象(如 GPT-6 Sol 实测)
榜单同时覆盖编码 Agent、办公 Agent、文本、图像与视频生成等分类。
所属事件:Arena 改版榜单总览上线,聚合实时评测信号(2 条相关)→
「模型」频道最新
- Qwen 3.8 27B 卡死循环:连写上百条「马上就跑测试」却始终不动手 — Graemer71 · 2026-09-25
- OpenCode 数据页现 Muse Spark 1.4 条目,Meta 新模型或临近发布 — kimmonismus · 2026-09-25
- Apple 公布各产品线端侧 AI 能力对照图表 — BenBajarin · 2026-09-25
- TypeSafe AI 评测模型 Jev 免费上线 Vercel AI Gateway — JohnPhamous · 2026-09-25
- 用户观察:Sol/Luna 更新后变弱,Astra 用量上限疑似静默放宽 — Shay_Solomon · 2026-09-25
- 网友推测 GPT 6 Luna/Sol 主打效率,意在配合 Cerebras 千 tok/s 推理 — brandon_galang · 2026-09-25