LOPD自蒸馏新法:胜GRPO,rollout预算仅三成

burny_tech · x · 2026-08-16

一篇关于 Self-Evolving AI 的论文提出 LOPD(Latent On-Policy Self-Distillation,隐空间在线自蒸馏)。要解决的问题是:传统在线自蒸馏(OPSD)需要人工设计教师模型的"特权上下文"(teacher's edge),费力且难以扩展。LOPD 让模型端到端地自己学习这份特权上下文——把相关历史经验转化为连续的隐向量 token 来条件化教师模型,同时给学生模型密集的逐步监督。

实验结果:LOPD 在编码与工具使用基准上超过标准 RLVR 和 OPSD,而 rollout 预算不到 GRPO 所需的 30%。作者认为,让上下文在隐空间中变得可学习,是迈向真正自主的 agent 训练的重要一步。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →