Opus 5 跑分占优但实战体验引发争议
Anthropic 的 Opus 5 模型在发布后引发了关于基准测试与实际体验差异的讨论。尽管 Opus 5 在公开跑分上表现优异,但多位用户反馈其在实战中的表现不如预期。有 Reddit 用户指出,在创意类等相似任务中,Fable 5 的实际表现明显强于 Opus 5。此外,还有用户表示前代 Opus 4.8 在非编程任务上更为出色,认为 Opus 5 似乎更倾向于“刷榜”而非全面能力提升。
2026-07-28 ~ 2026-07-28 · 3 条相关
- Reddit 用户称 Fable 5 实战胜过 Opus 5 但基准落后 — dominguezpablo · 2026-07-28
- Anthropic 的 Opus 4.8 非代码任务更强,但 5 代刷榜更好 — burkov · 2026-07-28
- Anthropic 的 Opus 5 跑分赢了,私有评测却说法不同 — FinanceYF5 · 2026-07-28