Opus 5 被指刷榜优化,但整体仍落后 Fable
bindureddy · x · 2026-07-25
这条在谈 Opus 5 的基准表现:作者称它在和 Sol、Kimi K3 竞争时明显在“刷榜式优化”。
配图里的表格显示,Opus 5 在 LiveBench 上略低于 Fable,但在一些公开首轮基准上分数更好,因此更容易拿去发推炫成绩。作者最后判断:它仍是个好模型,但 Fable 更强。
所属事件:Claude Opus 5 被指刷榜优化,实测仍落后(2 条相关)→
「模型」频道最新
- Miles Brundage 吐槽 Opus 5 先抄梗再装原创 — Miles_Brundage · 2026-07-25
- Kimi K3.0 abliterated GGUF 在 Hugging Face 走红 — audnai · 2026-07-25
- 早期反馈称 Opus 5 更冷,少了 4.7–4.8 的顶嘴感 — teortaxesTex · 2026-07-25
- Grok确认Anthropic Opus 5即将发布 — iruletheworldmo · 2026-07-25
- Opus 5 把免责声明式措辞比作“穿别人的外套” — RileyRalmuto · 2026-07-25
- 研究者称一种通用越狱可横跨 GPT-5.6、Opus 5 和 Fable — Polymarket · 2026-07-25