Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data
Yinhao Tang, Youqing Fang, Yanan Sun, Jiangning Liu, Ziyi Wang, Xun Zhao, Weiming Zhang, Bin Liu, Kuikun Liu, Wenwei Zhang, Kai Chen
cs.AI
2026-08-24
中科大与上海 AI Lab 在 Qwen3-30B 上对比:无思维链与长思维链混训 SFT,RLVR 后九项平均 61.1,高于 NTR 的 58.3,训练只要 65.6 GPU 小时。
推理后训练缺的是带长思维链的轨迹。课本推导、题解、论文压缩解释这类 no-CoT 文本量大,但没有显式推理过程。最近一批工作把「先想再预测下一块文本」做成强化学习,称为 next-chunk reasoning,并报告比在同一批 no-CoT 上做 SFT 更好。对照几乎都是只训 no-CoT 的 SFT。中科大与上海 AI Lab 问的是:多出来的分,到底来自 RL 公式,还是只是更有效地见了这些数据。
他们补上被漏掉的对照:把 no-CoT 和长思维链放进同一轮 SFT,称为 Mixed SFT,然后再接同一套可验证奖励强化学习。
底座统一为 Qwen3-30B-A3B-Base,避免指令模型自带的后训练污染。数据从 AoPS 爬:DeepSeek-V3.2 生成并只留答对的长思维链 15.2 万条,约 19.5 亿 token;带简短题解、没有思维链的 no-CoT 42.1 万条,约 5.3 亿 token。五条路线随后接同一套 GRPO、DAPO-Math-17K 上的精确匹配奖励:
评测看 RLVR 之后的上限,不看中间 checkpoint。域内六套竞赛数学(AIME 24/25/26、HMMT 25/26、IMO-Answer,avg@32),域外 HLE、GPQA-Diamond、MMLU-Pro。SFT 与 RL 都在 H200 上跑,每个 RL 阶段 64 卡。
Mixed SFT 在 RLVR 前九项平均只有 27.5,比谁都低大约 20 分;RLVR 后到 61.1,第一。NTR 58.3,NSR 57.9。域内六项平均 67.4,比 NTR 高 3.1 分。算力更悬殊:SFT 65.6 GPU 小时,NSR 4283.7 小时(65 倍),NTR 4608.1 小时(70 倍)。
| 方法 | AIME25 | HMMT26 | GPQA-Dia. | HLE |
| Reasoning SFT + RLVR | 76.67 | 39.39 | 56.94 | 7.22 |
| Sequential SFT + RLVR | 69.27 | 35.23 | 54.55 | 6.79 |
| NTR + RLVR | 84.38 | 47.16 | 57.70 | 7.68 |
| NSR + RLVR | 80.92 | 46.02 | 56.31 | 7.72 |
| Mixed SFT + RLVR | 85.73 | 51.52 | 60.98 | 9.24 |
pass@n 上几家打平:AIME24/25 多家都到 93.33。差距主要在 avg@n,也就是每次抽样的期望正确率。机制上,NTR 的高熵过滤并没有对准「难推理 token」:抽 2048 个高熵位置,不推理直接预测正确率一直在 0.48 左右。生成轨迹会塌成短模板,熵和长度一起掉。压住熵塌缩以后,后训练上限还略低于原版 NTR。Mixed SFT 后再插一段 NTR 或 NSR,AIME24 从 87.50 降到 86.35 / 87.21。Sequential SFT 在 100 道 no-CoT 探针上 59.19,Mixed SFT 68.63,第二段长思维链把前面学到的题解覆盖了一部分。Mixed SFT 掉点来自格式:长思维链带 <think>,题解没有,混在一起会跳过推理或写出多个 think 块;RLVR 的可验证奖励会把格式拉回来。
算力紧的团队,与其给 no-CoT 再开一轮贵的推理重构 RL,不如在 SFT 里把题解和长思维链混在一起,把预算留给后面的可验证奖励。更关键的是评测时机:RLVR 前 Mixed SFT 看起来像训坏了,那是格式冲突,可验证奖励会把 <think> 格式拉回来。只看中间 checkpoint 会把最强初始化扔掉。
混训比例只试了一档,缺数据时该怎么配没扫。训练和主评测都是数学,GPQA 只覆盖部分科学题,代码、多语、非数学科学是否同样成立,作者写成未决。NTR 和 NSR 各只实例化一条已有方法,不代表所有 next-chunk 变体。Mixed SFT 的前训练掉点很大,若流水线没有后续 RLVR,它并不是能直接上线的模型。SFT 65.6 小时对 NTR 的 70 倍,是在 160 步、NTR/NSR 达到前训练峰值处量的,更长 RL 会不会翻盘,论文没跑。