Bridgewater、UIUC 和 MIT 给出首个 RLVR 非空泛化界
ddkang · x · 2026-07-21
来自 Bridgewater AIA Labs、UIUC 和 MIT 的新研究声称,首次为基于 RLVR(带可验证奖励的强化学习) 的推理 LLM 给出非空洞的泛化界,目标是回答“在训练集上学到的能力,能否对未见数据给出理论保证”。
方法
- 他们把 PAC-Bayes 压缩界 改造到 RLVR 上,因为标准 PAC-Bayes 在 RLVR 里会被随机 token 解码这一点卡住。
- 通过 Gumbel-max trick,把原本随机的解码过程重参数化成“随机噪声的确定性函数”,从而推导出可用的界。
- 论文给出的是对百万/十亿参数级 RLVR 模型在未见数据上的高概率准确率下界。
结果与意义
- 论文强调,这类界限对“用私有数据训练专用模型并希望获得上线准确率保证”的场景更有实践价值。
- 作者也承认还有开放问题,比如 非平稳环境(例如实时工具 API)以及 分布外评测。
实验
- 在 Qwen3.5-4B 上,覆盖 数学、代码、通识、Text-to-SQL 四个领域。
- 推导出的界与训练准确率相差约 8–13%,同时比基座模型准确率高 17–51%。
- 为了让界不至于空洞,作者提出 Progressive RLVR:把 on-policy distillation、TinyLoRA 和量化 组合起来,在不明显掉性能的情况下大幅压缩模型。
所属事件:Bridgewater等机构联合提出首个RLVR非空泛化界(6 条相关)→
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22