长文:后训练 benchmark 乱局,评测草台班子与中心化之弊
SonglinYang4 · x · 2026-09-05
作者借知乎讨论谈后训练 benchmark 的结构性问题,核心论点:
- 任何 benchmark 终将饱和,而 reasoning/coding 评测随工业界后训练发展越来越泛化、众包化。LLM eval 一直是「草台班子」:每家自设 setting,从早期调 temperature/topp/length,到如今调 harness/setting,只要不统一就存在操作空间,结果皆可 cherry-pick。
- AA(AbstractsArena 类中心化评测)的问题:它给出了相对规范的 setting,但只要评测非中心化就必然有噪声,其官方 95% 置信度结果反而成了 judge 模型能力的标杆。代价是:没有亮眼 AA 分数的模型,即便体感、working、CUA 打磨得再好也无人问津——模型要 sell 就得迎合评测中心化组织。
- 职业任务三分法:已被 AI 训练好的、无法被 AI 训练的、还在被 AI 训练的。所有 Computer Use 类任务属第三类,模型解决它们仍需数年进化。
- 众包 benchmark 决定优化方向:OSWorld v2、ALE、TB4/TB-Sci 等 frontier 众包 benchmark 正变成第三类任务的闭包,决定未来数月基模团队的优化方向;越 frontier 噪声越大,若 benchmark 团队不为错题率负责,只会诞生更多「错题 benchmark」——GPQA-Diamond、HLE 及大量弱模型充斥其中。
「模型」频道最新
- Artificial Analysis 更新榜单方法,小幅修订致排名剧变引质疑 — solyarisoftware · 2026-09-06
- Astra 饱和空间推理基准,博主直呼「LLM 视觉已解决」 — lukaszkaiser · 2026-09-06
- Nvidia 携手 CrowdStrike 打造网络安全 AI 模型 — israelavila · 2026-09-06
- Plus 用户多模型分工工作流:ASTRA 只当架构师省额度 — KhaaliSeDin · 2026-09-06
- 阿里发布 Qwen-Drive-1.0-4B:4B 视觉语言模型瞄准自动驾驶场景理解 — solyarisoftware · 2026-09-06
- 实测打脸宣传:Astra 着色器生成竟不敌 GLM — teortaxesTex · 2026-09-06