研究员 kalomaze 批评「pass@512 刷 GSM8K」式论文缺乏批判性

kalomaze · x · 2026-08-27

ML 研究者 kalomaze 讨论一篇关于稠密奖励(dense reward)的论文:论文本身立场中立、措辞谨慎,稠密奖励的框架也不无价值。

但他批评一类常见论文对「Qwen 在 pass@512 下也能解 GSM8K」这类说法不加审视——这种表述实为一种终止思考的陈词滥调。他进一步指出,这类判断要求你预设一种朴素实在论的本体论,去区分「真正的学习」与「稀疏的分布重塑」,而更合理的做法是把后者视为有效学习的一个子集。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →