Qwen3.5-4B 的 RLVR 泛化界逼近训练精度 8% 到 13%

ddkang · x · 2026-07-21

Qwen3.5-4B 的 RLVR 泛化界首次做到非空洞,4 项任务内逼近训练精度 8–13%

Bridgewater AIA Labs、UIUC 和 MIT 发表了一项关于推理模型 RLVR 泛化能力的研究,作者称这是他们看到的首个在真实问题上“非空洞”的泛化上界。

在 Qwen3.5-4B 上,他们在 数学、代码、通用知识、Text-to-SQL 四个任务中验证:

消融结果显示每个组件都关键:去掉蒸馏或直接用 TinyLoRA 训练会让界更松;把 TinyLoRA 换成标准 LoRA,在 4B 模型上会让上界变得空洞,在 2B 模型上甚至失去意义。

所属事件:Bridgewater等机构联合提出首个RLVR非空泛化界(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →