ReOPD:蒸馏推理轨迹效果胜 SFT,离线版提速 4 倍
heghbalz · x · 2026-08-15
研究者发布 ReOPD 并放话:如果你手里有(玩笑说法是"不小心偷到的")强模型的推理轨迹,SFT 并不是利用它们的最佳方式——ReOPD 效果明显更好。做法是把推理轨迹切分成多个领域,在每个领域上分别训练专家模型。
配套的离线 OPD 变体已全部开源(代码、模型、数据),相比在线版本提速 4 倍,无需在线环境,且性能无退化。预印本已同步放出。
「研究」频道最新
- Gemma 4 E2B 架构详解:50亿参数跑出23亿性能 — dejanseo · 2026-08-15
- Nof1 论文:探索 AI 自适应与长视野优化 — jparkerholder · 2026-08-15
- 苏格拉底式训练可减少 AI 讨好型倾向 — AnnaCiaunica · 2026-08-15
- 新论文探讨大脑布线逻辑:计算机科学家能否构建大脑? — KordingLab · 2026-08-15
- ACML2026 亚太音乐智能研讨会启动征稿 — affige_yang · 2026-08-15
- DSH 被指非人接口,挑战在于稳定强化学习 — teortaxesTex · 2026-08-15