LMSYS 新训练法 OPD:让 Qwen3.5 推理提速 3 倍且精度提升

ying11231 · x · 2026-07-23

LMSYS 旗下训练系统 Miles 正式将在线策略蒸馏设为一级训练原语。在首次实验中,纯 OPD 技术成功让 Qwen3.5-35B-A3B 模型的推理长度缩短了约 3 倍,且在未使用任何任务奖励的情况下略微提升了准确率。

在受控的自我蒸馏实验中的核心亮点包括:

团队下一步计划探索 OPD 增强强化学习、规模扩展研究以及多教师 OPD 等方向。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →