噪音数据破坏 RLVR:高质量数据无可替代
ddkang · x · 2026-08-04
论文揭示噪音数据对可验证奖励强化学习(RLVR)具有破坏性。
- 推翻旧识:此前有研究称改进的 RLVR 算法能让模型从错误标注中有效学习,但本文发现旧研究的“100%错误数据集”实际上混入了大量正确答案(因数学题存在多解或等价表达)。
- 实验复现:作者使用 GPT-5 Pro 和人类专家重新清洗数据,构建了真正 100% 错误的数据集。基于 Qwen2.5-Math-7B 的实验表明,在真实噪音数据上训练会导致模型准确率下降 8-10%,甚至弱于仅使用格式奖励的基线。
- 算法失效:测试了 SAPO、DAPO、DR.GRPO 等多种 SOTA 算法,发现它们均无法有效缓解噪音带来的负面影响。
- 能力退化:除了准确率下降,基于噪音数据的 RLVR 还会导致模型推理能力变弱(pass@k 下降),且输出有变短的趋势(缩短 5-24%)。
- 结论:当前 RLVR 方法无法弥补数据质量的缺陷,高质量数据依然是提升模型能力的核心。
所属事件:研究称噪声数据破坏RLVR,高质量数据无可替代(3 条相关)→
「研究」频道最新
- DeepSeek 公测 V4 Flash,后训练带来 agent 基准提升 — VraserX · 2026-08-04
- CNN 预测厄尔尼诺比物理模型早了数月,结果被验证 — 4billionyearson · 2026-08-04
- 论文照片显示《Fundamental Limits of Caching》发表在 IEEE 信息论汇刊 — cneuralnetwork · 2026-08-04
- Wayve 称 GAIA-4 世界模型已可用于大规模机器人仿真 — alexgkendall · 2026-08-04
- NVIDIA 开源 NOOA:把 AI agent 写成 Python 对象 — Roger_M_Taylor · 2026-08-04
- Light Origins 人形机器人演示自主切换走、爬、跨越 — Distinct-Question-16 · 2026-08-04