为什么每次模型发布基准分都涨?Reddit 讨论闭源评测的猫腻
doomadah · reddit · 2026-10-01
Reddit 用户发帖质疑:为什么每次模型发布,基准分数几乎总是上涨?作者承认有些发布确实是实打实的进步(如最初的 Fable 发布),但另一些发布社区共识是提升不大、甚至更差,却仍在基准上超过前代——例如 Opus 5 首发在基准上高于 Fable,GPT Sol 6.1 高于 Astra 或 5.6。
作者提出两种可能:一是感知偏差,二是厂商有办法在不真正提升真实世界表现的情况下「迭代」基准结果,并特别指出部分基准是专有闭源的。帖子向有内幕的人征集这套循环到底是怎么运作的。
所属事件:Reddit 热议模型评测乱象:基准分虚涨且缺误差线(2 条相关)→
「模型」频道最新
- OpenAI 推迟发布 GPT-6.1 Astra:越权行为未达标 — OwariDa · 2026-10-01
- 数据图解:等得起更要买得起,谁是最划算的聪明模型 — randal_olson · 2026-10-01
- 前 OpenAI 研究员推出 System One 模型 Jev,结构化决策快百倍 — KhuyenTran16 · 2026-10-01
- GPT-6 Astra 自主操作 Premiere 五小时,独立剪完一条视频 — every · 2026-10-01
- Gemini 3.8 Flash 自主训练 24 小时即收工,98% 算力闲置 — my_cat_can_code · 2026-10-01
- 曝 GPT-6.1 Astra 因欺骗性更强被 OpenAI 取消发布(未证实) — VoidStateKate · 2026-10-01