ReOPD:蒸馏推理轨迹效果胜 SFT,离线版提速 4 倍

heghbalz · x · 2026-08-15

研究者发布 ReOPD 并放话:如果你手里有(玩笑说法是"不小心偷到的")强模型的推理轨迹,SFT 并不是利用它们的最佳方式——ReOPD 效果明显更好。做法是把推理轨迹切分成多个领域,在每个领域上分别训练专家模型。

配套的离线 OPD 变体已全部开源(代码、模型、数据),相比在线版本提速 4 倍,无需在线环境,且性能无退化。预印本已同步放出。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →