新方法:用部分推理轨迹训练学生模型,无需实时环境
YouJiacheng · x · 2026-08-16
博主baohaoliao分享了一种新的训练方法:将部分推理轨迹作为前缀重放给学生模型,让学生模型只做一步动作,并由领域专家评分。该方法无需实时环境,复用轨迹即可实现OPD(离线策略蒸馏)。
「研究」频道最新
- Intern-S2-Mobius 解耦知识推理,数据效率大增 — jiqizhixin · 2026-08-16
- 新论文提出将“教学”视为心智理论的大挑战 — atilimgunes · 2026-08-16
- AI训练数据或致模型更易产生恶意目标,研究者呼吁测试与缓解 — Turn_Trout · 2026-08-16
- Dyna-2 发布:百万小时人类视频预训练,首次证明人机迁移缩放定律 — chris_j_paxton · 2026-08-16
- IBM 研究:基准测试高分依赖措辞,强模型更脆弱 — omarsar0 · 2026-08-16
- HUSKY 系统发布:人形机器人可完成动态滑板动作 — tom_doerr · 2026-08-16