美团 LongCat 提出 N-OPSD:邻近专家池自蒸馏,AIME 均值最高提升 2.75 分
meituan-longcat · hf · 2026-10-02
美团 LongCat 团队改进 on-policy self-distillation(OPSD)数学推理训练方法,提出 Neighborhood OPSD(N-OPSD):
- 核心思路:标准 OPSD 用单一特权教师(可见参考解)监督学生采样的前缀;N-OPSD 发现对参数做局部扰动能得到互补的参考对齐修正,不同专家在不同参考位置提供修正,覆盖面比单一教师更广
- 离线构建:贪心筛选一个小型冻结专家池,以「过滤后的参考 token 增益」为选择标准
- 在线路由:MaxPeak 选锚定 token,分位数选择从 top token 匹配的专家中挑选,学生通过 clipped forward-KL 学习完整下一 token 分布
- 结果:在 AIME 2024/2025 与 HMMT Feb 2025 上,Qwen3-1.7B/4B/8B 的 Average@12 分别比 OPSD 提升 2.75、1.67、1.94 分;消融验证了各组件有效性,推理只需蒸馏后的学生模型
「研究」频道最新
- 高德发布 ABot-Recon:仅靠 12 帧局部上下文实现流式长视频 3D 重建 — rsasaki0109 · 2026-10-02
- Neuralink 用 5 万小时神经数据预训练解码器,护城河或在数据集而非植入体 — CurieuxExplorer · 2026-10-02
- 安全评测 CyberGym 在验证子集上已被 Agent 刷饱和 — aryaman2020 · 2026-10-02
- SemEval-2027 新任务征集:四语言多模态新闻框架分析 — preslav_nakov · 2026-10-02
- 提示词与模型交替升级:科学 agent 准确率从 42% 提到 73% — rohanpaul_ai · 2026-10-02
- ISMIR 论文:交叉注意力让模型学会 12 位爵士钢琴大师风格 — umpedronosapato · 2026-10-02