Claude Opus 5 在 WeirdML v2 上几乎追平 Fable 5
scaling01 · x · 2026-07-27
Claude Opus 5 在 WeirdML v2 上几乎追平 Fable 5
最新的 WeirdML v2 结果里,Claude Opus 5 (high) 得到 91.6%,Opus 5 (max) 得到 91.8%,几乎追平 Fable 5 (max) 的 91.9%,而成本更低。
- WeirdML v2 把任务数从 6 个扩展到 19 个。
- 这次更新还加入了 API 成本 等元数据。
- 结果显示出很清晰的成本/性能权衡,并且有 来自 6 家公司的 11 个模型 在某些成本区间里占据最优前沿。
- 配图展示了最新模型在准确率与单次运行成本上的整体分布。
所属事件:Claude Opus 5 在 WeirdML v2 测试中表现亮眼(2 条相关)→
「模型」频道最新
- 本地部署的 Kimi K3 被指在物理模拟上胜过 GPT-5.6 — eyishazyer · 2026-07-28
- Reddit 讨论 KIMI-K3 通过 OpenRouter 是否仍有护栏 — Suhan_XD · 2026-07-28
- Kimi K3 的 1.6TB 权重背后,或是 20–40 万亿 tokens — johnseach · 2026-07-28
- Kimi K3 2.8 万亿开源模型冲击 Anthropic 200 美元订阅 — haider1 · 2026-07-28
- OpenAI 的“GPT-6”玩梗拿推理降本和效率提升开刀 — daniel_mac8 · 2026-07-28
- 回复称下一版 Codex 可能周二发布,Cerebras 也将跟进 — eyishazyer · 2026-07-28