NVIDIA 提出最小二乘策略蒸馏 LSPD,蒸馏可省 75% rollout 批次

nvidia · hf · 2026-09-29

NVIDIA 团队从强化学习视角重新审视在线策略蒸馏(OPD),将 reverse-KL 目标与 KL 正则化策略优化建立联系,并在此基础上提出 RL 启发的 LSPD 框架,把基于价值 RL 中的乐观探索与离线数据复用引入策略蒸馏。

要点:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →