新模型好到人类分不出?Reddit 热议基准分数成唯一差异化指标

Tim_Apple_938 · reddit · 2026-10-05

Reddit 用户提出一个理论:新一代模型的基础水平已经高到普通用户凭体验难以区分优劣——不引用基准测试,你能说出 Astra 比 Fable 好在哪、Opus 5.5 比 6.1 Sol 强在哪吗?

作者进一步推论:如果人类真的分不出来,那么对私有实验室而言,「刷基准」(bench maxing)反而成了最值得砸钱的事,因为基准分数是唯一能对外证明差异化的指标。

评论区围绕「感知差异消失是否会让评测体系取代真实体验成为模型竞争的核心」展开讨论。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →