Claude Opus 5 在 LiveBench 逼近前排,实测仍落后 Fable 5
bindureddy · x · 2026-07-25
Bindu Reddy 认为,Claude Opus 5 在 LiveBench 上已经接近 Sol 6 和 Fable 5,但更像是“刷榜”后的结果。
他补充说,自己在真实测试里看到的表现,Opus 5 仍然低于 Fable 5 和 Sol 6,尤其是在长时间循环、持续执行这类场景中,基准分数并不能完整反映实际能力。
他给出的几个判断
- LiveBench 上,Opus 5 仅次于 Sol 6 和 Fable 5。
- 真实使用里,它仍落后于这两款模型。
- 现有 benchmark 对长链路、长时任务的覆盖不够。
- 他认为在各自价位段里,Fable 5、Kimi K3 和 Grok 4.5 目前最强。
「模型」频道最新
- Zvi 说 Opus 5 病毒学不输 Fable,引出安全管控问题 — TheZvi · 2026-07-25
- Opus 5 在 ARC-AGI 1/2 上进步,疑似靠代数化解题 — herbiebradley · 2026-07-25
- Polymarket 估算美国 AI 安全法案通过率 34%,Claude Opus 5 也被提到 — Polymarket · 2026-07-25
- Moonshot AI 发布 Kimi K3:2.8 万亿参数和 100 万上下文 — dl_weekly · 2026-07-25
- Anthropic 的 Claude 发布节奏据称从四个月一次提速到月更 — dustinvtran · 2026-07-25
- Claude Opus 5 认为自己有 41% 可能值得道德考虑 — imjustnewatai · 2026-07-25