新算力观点称,90% 的基准分数差异可由单一因素解释
nabeelqu · x · 2026-08-04
围绕 benchmark 评分方差与算力关系的一段讨论指出:大约 90% 的分数差异,可能都能被单一因素解释。发帖者把这个因素称为“effective compute”,并把它类比为“机器版的一般智能因子”。
被引讨论进一步对比了两种思路:
- 一种是不断加入新 benchmark,指望误差彼此抵消;
- 另一种是强调 准确率与 effective compute 之间稳定的对数 S 型关系,而且这种关系在训练阶段和 test-time compute 中都存在。
核心意思是:benchmark 当然要足够广,但很多评分差异可能并不像表面上那样分散,而是被同一个底层变量强烈主导。
「研究」频道最新
- 语义地图索引 6.6 万集播客与 70 万条观点 — g_pal · 2026-08-04
- Mila 在拉各斯展示非洲语言大模型实践 — Mila_Quebec · 2026-08-04
- 论文称选择性冻结参数可降低持续预训练成本 — ttkciar · 2026-08-04
- Epoch AI 的 MirrorCode 基准首次见 Claude Fable 解出两项任务 — Jsevillamol · 2026-08-04
- NeurIPS 梗图:作者等 rebuttal 像在等待戈多 — MelMitchell1 · 2026-08-04
- 研究者称 RLVR 在噪声标签上的增益只是虚假提升 — StellaLisy · 2026-08-04