数据混合算法 On-Policy Mix 入选 NeurIPS,贯通预训练到指令微调

alexisjross · x · 2026-09-25

研究者 michahu8 宣布三项工作入选 NeurIPS,核心是 On-Policy Mix:针对持续学习中「如何随数据变化找到最优数据配比」这一未解难题,提出一种适用于预训练、中期训练和指令微调全阶段的数据混合算法,作者附六条推文长贴详解。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →