研究员 kalomaze 批评「pass@512 刷 GSM8K」式论文缺乏批判性
kalomaze · x · 2026-08-27
ML 研究者 kalomaze 讨论一篇关于稠密奖励(dense reward)的论文:论文本身立场中立、措辞谨慎,稠密奖励的框架也不无价值。
但他批评一类常见论文对「Qwen 在 pass@512 下也能解 GSM8K」这类说法不加审视——这种表述实为一种终止思考的陈词滥调。他进一步指出,这类判断要求你预设一种朴素实在论的本体论,去区分「真正的学习」与「稀疏的分布重塑」,而更合理的做法是把后者视为有效学习的一个子集。
「模型」频道最新
- 实测表明 ChatGPT 中等推理强度性价比最高 — brandon_galang · 2026-08-27
- GLM-5.3-Flash 降本七成,国产芯片推理性能对标顶尖 — The Decoder · 2026-08-27
- Kimi K3 定价曝光:输入 3 美元/百万 tokens — DavidBennett__ · 2026-08-27
- 同个提示词下 Gemini 和 GPT 行为截然不同 — Icy_Lemon9237 · 2026-08-27
- Minimax H3 Max 是什么?新模型引关注 — aiyakisoba · 2026-08-27
- Anthropic 发布 27 分钟官方 Claude 提示词工程工作坊 — aftahi_ai · 2026-08-27