Agent Arena 榜单:GPT-6 Astra 重塑 Pareto 前沿,每任务 $4.01 换 +12.55%
arena · x · 2026-09-09
Arena 的 Agent Arena 排行榜基于真实长程任务(网页、文件系统、终端工具)衡量各模型的净提升幅度。GPT-6 Astra (Max) 重塑了 Pareto 前沿:每任务 $4.01 换取 +12.55% 的净提升;再多花约 7% 的钱($4.30)可换 Claude Fable 5.1 (Max),净提升高 2 个百分点至 +14.5%。$4.01 以下无模型净提升更高。
与传统投票式排行榜不同,Agent Mode 将真实会话随机路由到不同模型,依据模型作为编排者实际调用工具完成任务的单一反馈打分,覆盖数百万条真实交互。
所属事件:Agent Arena:GPT-6 Astra 重塑性价比前沿(2 条相关)→
「模型」频道最新
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 实测找 105 个隐藏 bug:DeepSeek V4.1 Flash 得 24 分,成本仅 Opus 5 的 3.5% — ChartsJournalX · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11
- Nex N2.5 Pro 开源发布,权重体积达 407GB — jinnyjuice · 2026-09-11