Reddit 热议模型评测乱象:基准分虚涨且缺误差线
Reddit 社区近日热议 AI 评测的公信力问题。有用户质疑,为何每次新模型发布基准分数几乎总是上涨,虽然部分发布确属实质性进步,但另一些社区共识认为提升不大甚至更差的模型也能拿到更高分数。另有评论者吐槽各大 AI 实验室公布 benchmark 成绩时从不附上 95% 置信区间误差线,称所有厂商皆是如此,并认为加上误差线才能让技术演进时间线的判断更严谨。
2026-10-01 ~ 2026-10-01 · 2 条相关
- benchmark 报告该加 95% 置信区间了:吐槽评测分数无误差线 — rmcwhorter99 · 2026-10-01
- 为什么每次模型发布基准分都涨?Reddit 讨论闭源评测的猫腻 — doomadah · 2026-10-01