研究发现混合 SFT 在无 CoT 数据下优于 Next-Chunk RL
Yinhao Tang · hf · 2026-08-27
研究在无思维链数据的场景下,重新审视了训练策略。结果显示,在混合推理语料库上进行混合监督微调(SFT),在数学任务和域外任务上的效率和最终准确率均优于 Next-Chunk 强化学习方法。
「研究」频道最新
- Gaussian 技术实现 Clug 角色面部表情动画 — repligate · 2026-08-27
- Lightwheel 联合 Hugging Face 发布 10 万小时具身人类数据集 — vanstriendaniel · 2026-08-27
- PyTorch 生态新增 Perforated 等 10 个项目 — zhyncs42 · 2026-08-27
- V-Rubrics:基于细粒度标准的视觉忠实度强化学习 — liuziwei7 · 2026-08-27
- FlashKDA 参考实现默认下限已设为 -5 — YouJiacheng · 2026-08-27
- 可解释性研究暂缺数学级突破,百年来或难解心智之谜 — ericjmichaud_ · 2026-08-27