LMSYS 新训练法 OPD:让 Qwen3.5 推理提速 3 倍且精度提升
ying11231 · x · 2026-07-23
LMSYS 旗下训练系统 Miles 正式将在线策略蒸馏设为一级训练原语。在首次实验中,纯 OPD 技术成功让 Qwen3.5-35B-A3B 模型的推理长度缩短了约 3 倍,且在未使用任何任务奖励的情况下略微提升了准确率。
在受控的自我蒸馏实验中的核心亮点包括:
- 准确率提升:DAPO 得分从 0.8457 升至 0.8945
- 响应大幅缩短:生成长度从约 1.86 万 tokens 降至 0.55 万至 0.67 万
- 学生模型收敛:反向 KL 散度从 0.045 降至 0.010
- 高效评分:采用稀疏的按位置教师评分,替代了密集的 O(R²K) 负载
- 灵活易用:支持运行纯蒸馏,或 OPD 结合 GRPO/PPO 奖励
团队下一步计划探索 OPD 增强强化学习、规模扩展研究以及多教师 OPD 等方向。
「研究」频道最新
- 手工核查 105 篇论文:复现失败多因代码缺失和结果不一致 — ChenhaoTan · 2026-07-23
- 用代理网关阻断智能体工具调用死循环 — bulleykebaal · 2026-07-23
- 《NEJM AI》刊文:生成式AI干预有效缓解大学生抑郁焦虑 — zakkohane · 2026-07-23
- Cohere将办演讲:探讨LLM智能体可靠性与不确定性信号 — Cohere_Labs · 2026-07-23
- Writer 研究揭示:优化 AI 外部架构可降本 41% 且不损精度 — bendee983 · 2026-07-23
- 数学推理轨迹或能揭示模型如何思考 — benno_krojer · 2026-07-23