Progressive RLVR 研究称 TinyLoRA 和蒸馏都不可少
ddkang · x · 2026-07-21
这组回复在讲 Progressive RLVR 的实验与消融结果,核心结论是:每个组件都很关键。
要点如下:
- 如果去掉蒸馏、直接用 TinyLoRA 训练,理论上界会变得更松,大约差 15%。
- 如果把 TinyLoRA 换成标准 LoRA,在 4B 模型上界会变得空洞,在 2B 模型上甚至基本失去意义。
- 在 Qwen3.5-4B 上,作者在 数学、代码、常识、Text-to-SQL 四个领域验证,得到的 bound 很紧,和训练准确率只差 8–13%,同时比基础模型高 17–51%。
配图展示了不同量化等级下的任务准确率曲线,Progressive + TinyLoRA 的表现最好,整体也显著优于随机猜测和基线模型。
所属事件:Bridgewater等机构联合提出RLVR非空泛化界(6 条相关)→
「研究」频道最新
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11