Anthropic Opus 5 基准领先但实战口碑分裂

近期多位社区用户针对 Anthropic 的 Opus 5 模型展开讨论,普遍认为该模型虽然在公开基准测试中表现近乎完美并击败了 Fable 5,但在真实使用场景中表现分裂,高分并未转化为更好的实际体验。这引发了业界对于模型是否“为刷榜而优化”以及现有基准测试是否已触及信噪比上限的质疑。

已确认

尚未确认

为什么重要

2026-07-28 ~ 2026-07-29 · 6 条相关

事件全程(共 14 集)→

一手来源