国大新研究 LOPD:让经验表示可学习,超越 GRPO 基线
青稞AI · wechat · 2026-08-26
针对 On-Policy Self-Distillation (OPSD) 中需手工定义特权上下文的问题,新加坡国立大学团队提出了 LOPD (Latent On-Policy Self-Distillation)。LOPD 不再手工设计特权信息,而是从历史成功经验中学习其表示,通过可学习的 Composer 将经验压缩为 Latent Context,并与 Policy 端到端联合优化。实验表明,LOPD 用不到 30% 的预算超越了 GRPO 等基线,显著提升了性能与样本效率。该研究将问题从“设计 Teacher Context”推进到了“学习 Experience Representation”。文章还预告了 8 月 29 日的作者直播分享。
「研究」频道最新
- 学者实测:2-3 轮迭代即可让前沿模型协作写出高质量评审 — anshulkundaje · 2026-09-21
- 学者计划每月 AI 辅助写 5-6 篇论文评审,效率翻倍 — anshulkundaje · 2026-09-21
- 学者呼吁建 AI 主导的科学期刊:投稿评审策展全交给 AI — anshulkundaje · 2026-09-21
- Waypoint Bio:AI 制药的瓶颈在数据而非模型 — anshulkundaje · 2026-09-21
- 研究估算:LLM 出现后美国自然失业率升约 0.1-0.2 个百分点 — mattbeane · 2026-09-21
- JevBench 开源:专注类型化决策模型的评测基准 — sull · 2026-09-21