Claude Opus 5 在 WeirdML v2 得分 86.3%,仍输出七千多 token

xeophon · x · 2026-07-26

WeirdML v2 上线了,把任务数从 6 个扩展到 19 个,还新增了 API 成本和更多元数据。引用中的结果显示,Claude Opus 5(no thinking) 在该榜单上拿到 86.3%,位置介于 GPT-5.5(xhigh)等高分模型之间。

这条帖子里还强调:即使关闭思考模式,Opus 5 平均仍会输出 7000+ tokens,而且成本还比 GPT-5.6 Sol (high) 略高。整个新版榜单展示了多个厂商模型在“成本—性能”上的前沿分布,整体上呈现出“花得越多,准确率越高”的明显趋势。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →