Agent Arena 实测:Opus 系列性能提升伴随 token 暴涨
arena · x · 2026-08-08
Agent Arena 在评估模型完成真实任务时发现,Anthropic 的 Opus 系列在性能显著提升(从 4.7 到 5)的同时,token 消耗量也大幅增加,从约 8.5k 飙升至约 21k(含推理和输出)。
相反,顶级的 GPT 模型呈现出相反的趋势。在 GPT-5.5 到 GPT-5.6-Sol 之间,尽管净性能提升了约 1.5 个百分点,但 token 使用量却从约 10k 下降到了约 8k。
「模型」频道最新
- 吐槽模型太聪明:Opus 5.0 表现得像个固执的资深科学家 — sokrypton · 2026-08-08
- OpenAI 称即将发布的 Astra(GPT-6) 为首个网安关键模型 — Endonium · 2026-08-08
- 实测 Claude Opus 5:文案获赞,但前端排版仍难交付 — yuwen_lu_ · 2026-08-08
- OpenAI 因安全顾虑暂停 Astra 模型开发 — The Verge AI · 2026-08-08
- 仅 8MB 的静态嵌入模型 Lattice:7 分钟跑完英文维基百科 — vanstriendaniel · 2026-08-08
- Qwen3.8-Max实测领先Gemini 3.5 Flash 8.5个百分点 — usamawahabkhan · 2026-08-08