论文指出所谓“全错”MATH 数据集漏掉了大量正确答案
burny_tech · x · 2026-08-04
- 这条帖子的核心是在指出一项先前研究的判断有缺陷:所谓 “100% wrong” 的 MATH 数据集 并没有真的是全错,而是数据构造过程漏掉了大量等价的正确答案。
- 作者强调,MATH 题目可能存在多个正确答案,以及表达上等价但形式不同的答案,因此把某些答案判成错误并不总是成立。
- 配图来自论文 《Spurious Rewards: Rethinking Training Signals in RLVR》,图中比较了 Qwen2.5-Math-7B、Qwen2.5-7B、Llama3.1-8B-Instruct、OLMo2-7B 在不同训练信号下的 MATH-500 准确率变化。
- 论文结论是:某些弱或“虚假”的奖励信号,确实能让部分 Qwen 模型在 MATH-500 上显著提升,但这种效果并不普遍,换到其他带有不同推理先验的模型上未必成立。
「研究」频道最新
- 神经符号模型被称可生成高可靠数值求解器 — GaryMarcus · 2026-08-04
- Claude Code 底层剖析:系统 Prompt 占比超 75%,体积激增 — ClaudeCodeLog · 2026-08-04
- 用生产 traces 做自蒸馏,让模型越用越强 — ypatil125 · 2026-08-04
- 阅读清单串起重构经济学、agent skills 和 Google 实践 — rseroter · 2026-08-04
- 做得扎实的负结果博士论文,也该能被答辩 — prajdabre · 2026-08-04
- 预注册研究称幻觉检测有通用下限但无通用器 — k01234n · 2026-08-04