Claude Opus 5 在 WeirdML v2 上几乎追平 Fable 5
scaling01 · x · 2026-07-27
Claude Opus 5 在 WeirdML v2 上几乎追平 Fable 5
最新的 WeirdML v2 结果里,Claude Opus 5 (high) 得到 91.6%,Opus 5 (max) 得到 91.8%,几乎追平 Fable 5 (max) 的 91.9%,而成本更低。
- WeirdML v2 把任务数从 6 个扩展到 19 个。
- 这次更新还加入了 API 成本 等元数据。
- 结果显示出很清晰的成本/性能权衡,并且有 来自 6 家公司的 11 个模型 在某些成本区间里占据最优前沿。
- 配图展示了最新模型在准确率与单次运行成本上的整体分布。
所属事件:Claude Opus 5 在 WeirdML v2 测试中表现亮眼(2 条相关)→
「模型」频道最新
- 决策模型 Jev 接入 OM1,在 NVIDIA Isaac Sim 中驱动 Go2 机器人导航 — paigeinsf · 2026-09-23
- 网友预测 2026 秋:Opus 5.5、GPT-6、Qwen4 同期登场 — IanAndrewsDC · 2026-09-23
- Cline 宣称 MiMo-v2.6-Pro 登顶开源权重模型榜 — burny_tech · 2026-09-23
- Anthropic 自嘲式官宣:Opus 5.5 远胜 Opus 5,网友戏称该向旧模型道歉 — repligate · 2026-09-23
- Opus 5.5 创作实测:「建议你把想要的都画出来」 — repligate · 2026-09-23
- Ofir Press 解释第三方跑分更高:任务子集与计分口径不同 — OfirPress · 2026-09-23