SimpleOPD 提升短上下文模型数学与科学推理

Shanghai-AI-Laboratory · hf · 2026-08-17

上海 AI 实验室提出 SimpleOPD,一种简单的与分词器无关的在线策略蒸馏方法。该方法将长上下文推理教师模型蒸馏到短上下文学生模型,通过对齐 token 跨度、约束长度增长和稳定训练,显著提升了数学证明推理能力并泛化至科学基准测试。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →