Agent Arena 榜单:GPT-6 Astra 每任务 3.94 美元,性能仅领先 11.7%
arena · x · 2026-09-17
Agent Arena 发布智能体性能排行榜,按各模型家族的净改进分(net improvement score)与每任务中位成本对比各家顶级模型。
核心发现:
- GPT-6 Astra (Max):+11.7% 净改进,但成本高达 $3.94/任务
- GPT-5.6 Sol (xHigh):+7.0%,$1.03/任务
- Claude Fable 5.1 与 GPT-6 Astra 共同的特点是:相比同实验室其他模型,性能接近但价格明显更高,性价比不占优
榜单详情可在 Agent Arena 网站查看。
所属事件:Agent Arena 成本榜:GPT-6 Astra 更贵未必更值(2 条相关)→
「模型」频道最新
- YC 用 GLM-5.2 造出 AI 合伙人,延迟比 OpenAI 低 31% — ycombinator · 2026-09-17
- GPT-6 命名科普:Astra 只是版本分层,不是所谓 GPT-6 本体 — flowersslop · 2026-09-17
- 「开放权重」≠ 开源:斯坦福 HAI 指出 AI 行业最爱的标签正引发争议 — StanfordHAI · 2026-09-17
- 「判断模型」Jev 想做快而便宜的决策,或重塑商业自动化 — The AI Daily Brief · 2026-09-17
- 未开源细节引猜测:并行解码与 LLM 结构化输出有何不同 — ricklamers · 2026-09-17
- fx 安全分类器实测:比 GPT-5.6-Luna 快 5-18 倍且更准 — cramforce · 2026-09-17