Agent Arena 改版:按 170 万会话划分任务类别,新增模型任务成本榜
arena · x · 2026-08-18
Agent Arena 认为,单纯看性能的 agent 排行榜已不够用:用户真正关心的是「我的这类任务哪个模型最强」和「完成这个任务要花多少钱」。团队分析了 Agent Mode 中超过 170 万条用户会话,识别出用户最常委托给 agent 的任务类别,并实测完成这些任务的真实成本。
本次更新推出两个互补功能:Agent Costs 展示各模型完成同一任务的花费,并提供 Pareto 前沿视图,直观呈现每个性能水平上性价比最高的模型;另一项则是按任务类别的细分排行。
「模型」频道最新
- Minimax M3.1 模型即将发布,48小时内上线 — ccerrato147 · 2026-08-18
- 爆料:Grok 4.7 将接入 SpaceX 工程数据 — JOBhakdi · 2026-08-18
- EngramLab 模型以 3.3 倍效率击败 Opus — soumitrashukla9 · 2026-08-18
- 趣评:Qwen 3.8 的思考像在纠结买硬件 — Elorun · 2026-08-18
- Huihui 推出 Qwen3.8-27B 去审查微调版 — huihui-ai · 2026-08-18
- 模型主动变笨?牺牲知识换取推理能力 — bibryam · 2026-08-18