Bridgewater、UIUC 和 MIT 给出首个 RLVR 非空泛化界
ddkang · x · 2026-07-21
来自 Bridgewater AIA Labs、UIUC 和 MIT 的新研究声称,首次为基于 RLVR(带可验证奖励的强化学习) 的推理 LLM 给出非空洞的泛化界,目标是回答“在训练集上学到的能力,能否对未见数据给出理论保证”。
方法
- 他们把 PAC-Bayes 压缩界 改造到 RLVR 上,因为标准 PAC-Bayes 在 RLVR 里会被随机 token 解码这一点卡住。
- 通过 Gumbel-max trick,把原本随机的解码过程重参数化成“随机噪声的确定性函数”,从而推导出可用的界。
- 论文给出的是对百万/十亿参数级 RLVR 模型在未见数据上的高概率准确率下界。
结果与意义
- 论文强调,这类界限对“用私有数据训练专用模型并希望获得上线准确率保证”的场景更有实践价值。
- 作者也承认还有开放问题,比如 非平稳环境(例如实时工具 API)以及 分布外评测。
实验
- 在 Qwen3.5-4B 上,覆盖 数学、代码、通识、Text-to-SQL 四个领域。
- 推导出的界与训练准确率相差约 8–13%,同时比基座模型准确率高 17–51%。
- 为了让界不至于空洞,作者提出 Progressive RLVR:把 on-policy distillation、TinyLoRA 和量化 组合起来,在不明显掉性能的情况下大幅压缩模型。
所属事件:Bridgewater等机构联合提出RLVR非空泛化界(6 条相关)→
「研究」频道最新
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 果蝇大脑 LLM 权重上架 Hugging Face,兼容 transformers 可直接跑 — ngxson · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11