国大新研究 LOPD:让经验表示可学习,超越 GRPO 基线

青稞AI · wechat · 2026-08-26

针对 On-Policy Self-Distillation (OPSD) 中需手工定义特权上下文的问题,新加坡国立大学团队提出了 LOPD (Latent On-Policy Self-Distillation)。LOPD 不再手工设计特权信息,而是从历史成功经验中学习其表示,通过可学习的 Composer 将经验压缩为 Latent Context,并与 Policy 端到端联合优化。实验表明,LOPD 用不到 30% 的预算超越了 GRPO 等基线,显著提升了性能与样本效率。该研究将问题从“设计 Teacher Context”推进到了“学习 Experience Representation”。文章还预告了 8 月 29 日的作者直播分享。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →