Qwen3.5-4B 的 RLVR 泛化界逼近训练精度 8% 到 13%
ddkang · x · 2026-07-21
Qwen3.5-4B 的 RLVR 泛化界首次做到非空洞,4 项任务内逼近训练精度 8–13%
Bridgewater AIA Labs、UIUC 和 MIT 发表了一项关于推理模型 RLVR 泛化能力的研究,作者称这是他们看到的首个在真实问题上“非空洞”的泛化上界。
- 方法上,他们用基于压缩的 PAC-Bayes bound 来分析 RLVR。
- 由于 RLVR 的目标依赖随机 token 解码,论文先用 Gumbel-max trick 把随机解码重参数化为噪声的确定性函数。
- 为了让上界不至于空洞,作者提出 Progressive RLVR,组合了:
- on-policy distillation
- 用于极致参数压缩的 TinyLoRA
- 量化
在 Qwen3.5-4B 上,他们在 数学、代码、通用知识、Text-to-SQL 四个任务中验证:
- 泛化界距离模型训练精度仅 8–13%
- 比 base model 精度高出 17–51%
消融结果显示每个组件都关键:去掉蒸馏或直接用 TinyLoRA 训练会让界更松;把 TinyLoRA 换成标准 LoRA,在 4B 模型上会让上界变得空洞,在 2B 模型上甚至失去意义。
所属事件:Bridgewater等机构联合提出首个RLVR非空泛化界(6 条相关)→
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- ICML 教程探讨:优化理论在 2026 年的相关性 — srush_nlp · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22