NVIDIA 提出最小二乘策略蒸馏 LSPD,蒸馏可省 75% rollout 批次
nvidia · hf · 2026-09-29
NVIDIA 团队从强化学习视角重新审视在线策略蒸馏(OPD),将 reverse-KL 目标与 KL 正则化策略优化建立联系,并在此基础上提出 RL 启发的 LSPD 框架,把基于价值 RL 中的乐观探索与离线数据复用引入策略蒸馏。
要点:
- 理论上其理想化形式在在线探索下达到 O(log K) 的紧遗憾界;
- 在 6 个数学推理基准和多种师生组合上平均超过现有蒸馏基线 1.59 分;
- Pass@k(至 k=64)评估显示 LSPD 更好地保留了策略多样性;
- 完全离线变体只用前 25% 的 rollout 批次即可达到普通 OPD 的相当性能,大幅节省采样成本。
「研究」频道最新
- 清华团队人形机器人羽毛球上线:30 分钟动数据学会正反手与跳杀回球 — ChongZzZhang · 2026-09-29
- 开源 AI 实现 X 光与 3D CT 亚毫米级配准,登上 Nature — Dr_Alex_Crimi · 2026-09-29
- 模拟人类意识:论文探讨在AI与机器人中构建意识的新前沿 — ugail · 2026-09-29
- UNSW 研究让 AI 扮演醉酒,模型更易违规泄密 — gaganghotra_ · 2026-09-29
- 176.9B 模型压到 1.89 有效 bpw,29.6GB 单卡跑 Coder 版 — Loginhe · 2026-09-29
- 用 judge 模型跑 GRPO 偏好长回答,或可解释 LLM 爱写长篇的通病 — djcows · 2026-09-29