真实噪声数据会击穿 RLVR:Qwen2.5-Math-7B 下降 9%
ddkang · x · 2026-08-04
噪声数据会显著破坏 RLVR 训练效果
这条线程对应一篇论文,核心结论是:此前一些“用错误标注也能学得很好”的 RLVR 结果并不成立,因为那些号称 100% noisy 的数据集其实混入了大量正确答案。作者用 GPT-5 Pro 和人工专家重新核验数据,剔除了 16% 误判为错误、实际上正确的样本。
- 他们以 Qwen2.5-Math-7B 为底座重新做 RLVR(GRPO)训练。
- 在真正噪声数据上,性能相比干净数据训练 下降约 9%,甚至比只用格式奖励还差。
- 在 AIME、AMC、MATH500 等基准上,SAPO、DAPO、TIS、DR. GRPO、PGFC 等改进算法都没能有效抵消噪声影响;在 50% 噪声下,至少有一个基准出现 5%+ 的精度下降。
- 另外,噪声训练还会让模型的 pass@k 更低、输出更短,说明推理能力也在变弱。
作者的结论很直接:现阶段 RLVR 还不能替代高质量数据,数据质量仍然是关键。
所属事件:研究称噪声数据破坏RLVR,高质量数据无可替代(3 条相关)→
「研究」频道最新
- 论文照片显示《Fundamental Limits of Caching》发表在 IEEE 信息论汇刊 — cneuralnetwork · 2026-08-04
- Wayve 称 GAIA-4 世界模型已可用于大规模机器人仿真 — alexgkendall · 2026-08-04
- NVIDIA 开源 NOOA:把 AI agent 写成 Python 对象 — Roger_M_Taylor · 2026-08-04
- Light Origins 人形机器人演示自主切换走、爬、跨越 — Distinct-Question-16 · 2026-08-04
- Google 论文称压制自我意识表述会改变模型信念 — alex_verem · 2026-08-04
- AI 生成论文越来越像真科学,匿名投稿和双盲评审先扛不住了 — SimonGColton · 2026-08-04