提出扩散大模型自蒸馏新范式

机器之心 · wechat · 2026-07-09

这篇由马普所、清华等机构完成的工作提出了 d-OPSD,用于扩散大语言模型的 on-policy self-distillation。 文章称,d-OPSD 不再依赖参考解或额外教师模型,而是让学生先在线采样,再把学生轨迹作为特权信息反馈给教师;实验显示,它在多个数学推理基准上可用更少训练步数达到或超过 RL 效果。

所属事件:扩散大语言模型自蒸馏新范式dOPSD提出(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →