SimpleOPD 论文:解决长上下文蒸馏中的 Token 不匹配

bronzeagepapi · x · 2026-08-18

新论文 SimpleOPD 提出了一种简单的 Token 无关策略蒸馏方法,旨在将长上下文教师模型的推理能力迁移到短上下文学生模型。针对 Tokenizer 不匹配、响应长度爆炸和训练不稳定等问题,该方法在共享文本空间进行操作,并对齐相同文本片段。实验显示,该方法在 Qwen3、GLM-4.7 等模型上均能带来数学推理能力的提升。

所属事件:上海AI实验室推出SimpleOPD在线策略蒸馏新方法(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →