Claude Opus 5 在 WeirdML v2 测试中表现亮眼
升级后的 WeirdML v2 基准测试将任务数扩展至 19 个,并引入了 API 成本等元数据。在最新测试中,Claude Opus 5 表现出色,得分达到 86.3%,尽管在未开启思考模式时输出了七千多个 token,但其整体成绩已几乎追平 Fable 5 模型。
2026-07-26 ~ 2026-07-27 · 2 条相关
- Claude Opus 5 在 WeirdML v2 得分 86.3%,仍输出七千多 token — xeophon · 2026-07-26
- Claude Opus 5 在 WeirdML v2 上几乎追平 Fable 5 — scaling01 · 2026-07-27