Qwen3.5-4B 的 RLVR 泛化界逼近训练精度 8% 到 13%
ddkang · x · 2026-07-21
Qwen3.5-4B 的 RLVR 泛化界首次做到非空洞,4 项任务内逼近训练精度 8–13%
Bridgewater AIA Labs、UIUC 和 MIT 发表了一项关于推理模型 RLVR 泛化能力的研究,作者称这是他们看到的首个在真实问题上“非空洞”的泛化上界。
- 方法上,他们用基于压缩的 PAC-Bayes bound 来分析 RLVR。
- 由于 RLVR 的目标依赖随机 token 解码,论文先用 Gumbel-max trick 把随机解码重参数化为噪声的确定性函数。
- 为了让上界不至于空洞,作者提出 Progressive RLVR,组合了:
- on-policy distillation
- 用于极致参数压缩的 TinyLoRA
- 量化
在 Qwen3.5-4B 上,他们在 数学、代码、通用知识、Text-to-SQL 四个任务中验证:
- 泛化界距离模型训练精度仅 8–13%
- 比 base model 精度高出 17–51%
消融结果显示每个组件都关键:去掉蒸馏或直接用 TinyLoRA 训练会让界更松;把 TinyLoRA 换成标准 LoRA,在 4B 模型上会让上界变得空洞,在 2B 模型上甚至失去意义。
所属事件:Bridgewater等机构联合提出RLVR非空泛化界(6 条相关)→
「研究」频道最新
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11