Opus 5 跑分占优但实战体验引发争议

Anthropic 的 Opus 5 模型在发布后引发了关于基准测试与实际体验差异的讨论。尽管 Opus 5 在公开跑分上表现优异,但多位用户反馈其在实战中的表现不如预期。有 Reddit 用户指出,在创意类等相似任务中,Fable 5 的实际表现明显强于 Opus 5。此外,还有用户表示前代 Opus 4.8 在非编程任务上更为出色,认为 Opus 5 似乎更倾向于“刷榜”而非全面能力提升。

2026-07-28 ~ 2026-07-28 · 3 条相关