Claude Opus 5 在 LiveBench 逼近前排,实测仍落后 Fable 5
bindureddy · x · 2026-07-25
Bindu Reddy 认为,Claude Opus 5 在 LiveBench 上已经接近 Sol 6 和 Fable 5,但更像是“刷榜”后的结果。
他补充说,自己在真实测试里看到的表现,Opus 5 仍然低于 Fable 5 和 Sol 6,尤其是在长时间循环、持续执行这类场景中,基准分数并不能完整反映实际能力。
他给出的几个判断
- LiveBench 上,Opus 5 仅次于 Sol 6 和 Fable 5。
- 真实使用里,它仍落后于这两款模型。
- 现有 benchmark 对长链路、长时任务的覆盖不够。
- 他认为在各自价位段里,Fable 5、Kimi K3 和 Grok 4.5 目前最强。
所属事件:Claude Opus 5 被指刷榜优化,实测仍落后(2 条相关)→
「模型」频道最新
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11