新方法:用部分推理轨迹训练学生模型,无需实时环境

YouJiacheng · x · 2026-08-16

博主baohaoliao分享了一种新的训练方法:将部分推理轨迹作为前缀重放给学生模型,让学生模型只做一步动作,并由领域专家评分。该方法无需实时环境,复用轨迹即可实现OPD(离线策略蒸馏)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →