Claude Opus 5 被指刷榜优化,实测仍落后
Claude Opus 5 在 LiveBench 基准测试中的表现引发争议。尽管其分数已逼近 Sol 6 和 Fable 5 等前排模型,但多方观点指出,该模型在与 Sol、Kimi K3 等竞品较量时存在明显的“刷榜式优化”现象。在实际的真实场景测试中,Opus 5 的整体表现依然落后于 Fable 5。
2026-07-25 ~ 2026-07-25 · 2 条相关
- 第 1 集:Anthropic 模型发布陷混乱,Opus 5 被指关乎成败(2026-07-23,2 条)
- 第 2 集:Anthropic 发布 Claude Opus 5:性能达新 SOTA 且价格减半(2026-07-25,90 条)
- 第 3 集:网传 Anthropic 发布 Opus 5,支持加速与科研顶配(2026-07-25,3 条)
- 第 4 集:Claude Opus 5 早期反馈:编码强但破坏旧工作流(2026-07-25,5 条)
- 第 5 集:Anthropic 称 Claude Opus 5 刻意限制网络安全训练(2026-07-25,5 条)
- 第 6 集:Claude Opus 5 被指刷榜优化,实测仍落后(2026-07-25,2 条)
- 第 7 集:Claude Opus 5 多榜单登顶成新 SOTA(2026-07-25,5 条)
- 第 8 集:Claude Opus 5 刷新 ARC-AGI-3 纪录并展现代数推理(2026-07-25,6 条)
- 第 9 集:Opus 5在FrontierCode测试中中等推理表现最佳(2026-07-25,8 条)
- 第 10 集:Claude Opus 5 视觉评测落后且成本高昂(2026-07-25,4 条)
- 第 11 集:Claude Opus 5 提供五档推理强度并默认开启(2026-07-25,2 条)
- 第 12 集:Opus 5早期体验:速度快但推理激进且啰嗦(2026-07-25,2 条)
- Claude Opus 5 在 LiveBench 逼近前排,实测仍落后 Fable 5 — bindureddy · 2026-07-25
- Opus 5 被指刷榜优化,但整体仍落后 Fable — bindureddy · 2026-07-25