Progressive RLVR 研究称 TinyLoRA 和蒸馏都不可少
ddkang · x · 2026-07-21
这组回复在讲 Progressive RLVR 的实验与消融结果,核心结论是:每个组件都很关键。
要点如下:
- 如果去掉蒸馏、直接用 TinyLoRA 训练,理论上界会变得更松,大约差 15%。
- 如果把 TinyLoRA 换成标准 LoRA,在 4B 模型上界会变得空洞,在 2B 模型上甚至基本失去意义。
- 在 Qwen3.5-4B 上,作者在 数学、代码、常识、Text-to-SQL 四个领域验证,得到的 bound 很紧,和训练准确率只差 8–13%,同时比基础模型高 17–51%。
配图展示了不同量化等级下的任务准确率曲线,Progressive + TinyLoRA 的表现最好,整体也显著优于随机猜测和基线模型。
所属事件:Bridgewater等机构联合提出首个RLVR非空泛化界(6 条相关)→
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- ICML 教程探讨:优化理论在 2026 年的相关性 — srush_nlp · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22