Claude Opus 5 在 WeirdML v2 得分 86.3%,仍输出七千多 token
xeophon · x · 2026-07-26
WeirdML v2 上线了,把任务数从 6 个扩展到 19 个,还新增了 API 成本和更多元数据。引用中的结果显示,Claude Opus 5(no thinking) 在该榜单上拿到 86.3%,位置介于 GPT-5.5(xhigh)等高分模型之间。
这条帖子里还强调:即使关闭思考模式,Opus 5 平均仍会输出 7000+ tokens,而且成本还比 GPT-5.6 Sol (high) 略高。整个新版榜单展示了多个厂商模型在“成本—性能”上的前沿分布,整体上呈现出“花得越多,准确率越高”的明显趋势。
所属事件:Claude Opus 5 在 WeirdML v2 测试中表现亮眼(2 条相关)→
「模型」频道最新
- MachgenAI:账户余额超25美元可免费用Minimax H3 Turbo生成 — TheMoonMidas · 2026-09-23
- 研究者观察:爱晒AI吹捧自己的多是反社会行为者 — repligate · 2026-09-23
- 评Opus 5.5:语料满是摘要的摘要,一手经验最稀缺 — mimi10v3 · 2026-09-23
- Claude Opus 5.5 登 FrontierSWE 第二名,62.3% 仅次于 GPT-6 Astra — scaling01 · 2026-09-23
- Claude 修复后回归,实测者称速度明显变快 — evielync · 2026-09-23
- 仅凭歌词加音频,Opus 5.5 复刻出视觉作品引开发者惊叹 — repligate · 2026-09-23