LOPD自蒸馏新法:胜GRPO,rollout预算仅三成
burny_tech · x · 2026-08-16
一篇关于 Self-Evolving AI 的论文提出 LOPD(Latent On-Policy Self-Distillation,隐空间在线自蒸馏)。要解决的问题是:传统在线自蒸馏(OPSD)需要人工设计教师模型的"特权上下文"(teacher's edge),费力且难以扩展。LOPD 让模型端到端地自己学习这份特权上下文——把相关历史经验转化为连续的隐向量 token 来条件化教师模型,同时给学生模型密集的逐步监督。
实验结果:LOPD 在编码与工具使用基准上超过标准 RLVR 和 OPSD,而 rollout 预算不到 GRPO 所需的 30%。作者认为,让上下文在隐空间中变得可学习,是迈向真正自主的 agent 训练的重要一步。
「研究」频道最新
- 港中文VideoCoCo:代码当思维链,文生视频懂物理 — 机器之心 · 2026-08-16
- 开源代理NullOrigin可实时去除LLM输出中的KGW水印 — theawkwardbong · 2026-08-16
- AI文本水印原理与规避方法详解:Anthropic等公司已采用 — SpiritRealistic8174 · 2026-08-16
- 病毒AI引发生物安全激辩:制造大流行易,防御需数月 — anshulkundaje · 2026-08-16
- ORBIT 训练范式:提升时序基础模型零样本预测能力 — chaumian · 2026-08-16
- Hamilton-Zero:求解量子基态的神经网络基础模型 — burny_tech · 2026-08-16