研究发现混合 SFT 在无 CoT 数据下优于 Next-Chunk RL

Yinhao Tang · hf · 2026-08-27

研究在无思维链数据的场景下,重新审视了训练策略。结果显示,在混合推理语料库上进行混合监督微调(SFT),在数学任务和域外任务上的效率和最终准确率均优于 Next-Chunk 强化学习方法。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →