Claude Opus 5 在 WeirdML v2 得分 86.3%,仍输出七千多 token
xeophon · x · 2026-07-26
WeirdML v2 上线了,把任务数从 6 个扩展到 19 个,还新增了 API 成本和更多元数据。引用中的结果显示,Claude Opus 5(no thinking) 在该榜单上拿到 86.3%,位置介于 GPT-5.5(xhigh)等高分模型之间。
这条帖子里还强调:即使关闭思考模式,Opus 5 平均仍会输出 7000+ tokens,而且成本还比 GPT-5.6 Sol (high) 略高。整个新版榜单展示了多个厂商模型在“成本—性能”上的前沿分布,整体上呈现出“花得越多,准确率越高”的明显趋势。
「模型」频道最新
- Grok 4.5 测试显示,大任务拆成低多边形块更有效 — Daniel_Farinax · 2026-07-26
- 有人直言:不发开权重是商业选择,阻止别人发才是问题 — rdesh26 · 2026-07-26
- Kimi K3 预计明天开放权重,开源阵营再添一弹 — Hot_Example_4456 · 2026-07-26
- Claude使用截图曝光Max计划限额与1775美元积分消耗 — letandrewcook · 2026-07-26
- 开源 4B 模型在瑞典医学考试上逼近 o3 水平 — AccomplishedCat4770 · 2026-07-26
- ChatGPT 两小时提示词产出一篇论文式数学推导 — airkatakana · 2026-07-26