为什么每次模型发布基准分都涨?Reddit 讨论闭源评测的猫腻

doomadah · reddit · 2026-10-01

Reddit 用户发帖质疑:为什么每次模型发布,基准分数几乎总是上涨?作者承认有些发布确实是实打实的进步(如最初的 Fable 发布),但另一些发布社区共识是提升不大、甚至更差,却仍在基准上超过前代——例如 Opus 5 首发在基准上高于 Fable,GPT Sol 6.1 高于 Astra 或 5.6。

作者提出两种可能:一是感知偏差,二是厂商有办法在不真正提升真实世界表现的情况下「迭代」基准结果,并特别指出部分基准是专有闭源的。帖子向有内幕的人征集这套循环到底是怎么运作的。

所属事件:Reddit 热议模型评测乱象:基准分虚涨且缺误差线(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →