规则指纹筛多样SFT轨迹,OLMo3未见环境覆盖高16.9点

Selecting Diverse SFT Traces Improves Post-RL Generalization

Dylan Zhang, Mingyuan Wu, Jinning Li

cs.LG, cs.AI

2026-09-28

同一验证解池里按规则指纹选出路线更散的SFT子集,OLMo3-7B在SFT未见环境上后RL的pass@8比选相似路线高16.9点,单教师下十个数学基准平均pass@8最多高6.2点。

这篇在解决什么

推理模型现在的标准后训练是两段:先在验证过的解答上做监督微调(SFT),再对自己的尝试做可验证奖励强化学习(RLVR)。RL 从 SFT 交出来的策略里采样。rollout 预算有限时,起点分布决定后面能发现哪些正确尝试。该问的已经是该留哪些验证解,不只是留多少。

现有流水线通常按可读性、长度、reward 分、每题配额来筛,并不问留下的解是不是在走不同的推理路线。同一道题可以有两条都对、分解和检查完全不同的解。如果 SFT 反复演示同一条路,更多题上可能一次正确尝试都采不到。对 GRPO 这类组内相对方法,一组 rollout 全对或全错,advantage 都是零,那道题等于白采。实验把解在走法上散不散叫做 route diversity,并在固定预算、同一候选池、对齐训练配方的条件下,直接选路线散或挤的子集,看后 RL 覆盖会不会分开。

方法

一条 route 就是一条验证解从题目走到答案的步骤序列。topology 是把措辞、格式、教师身份剥掉之后这条路径的结构。规则把推理文本切成步骤并打类型,压成定长 fingerprint:步骤频率、转移、前后段位置、路径形状。有领域标注就用标注,没有就从文本用固定规则打标,必要时再做一次固定随机投影。全程不调模型,也不重新生成或回传梯度,CPU 能扫超过两百万条候选。

同一池、同一条数,两套对照几何相反:

学生初始化、SFT 损失、GRPO 配方、评测协议、读数的 RL 步数全部对齐,只换留下哪些解。教师数量先当粗代理:同样演示条数,多教师对单教师。单教师池则全部候选由同一个模型写成,再按指纹选。

结果

RLVE 合成谜题上,SFT 覆盖难度 1 到 5,RL 延到 10,评测做到 15。OLMo3-7B 两边都从同一 64 环境池选 5 万条,随后在全部 384 个环境上做同一套 RL。SFT 没见过的环境上,diverse 的 pass@8 高 16.9 点。解题集合几乎是包含关系:diverse 保住 similar 做对题的 95.67%,另外独有 1133 题,similar 独有只有 53 题。

把教师数量当路线多样性的粗代理时,方向一致。Qwen3-4B-Base 上,12 教师相对 1 教师,Enigmata 留出题 pass@64 大约高 18 点。同一对 SFT checkpoint 转去 DAPO-Math-17k 做 RL,16 环境池上 MATH-500 的 pass@1 从 34.14% 升到 65.08%。

单教师条件下,全部候选由 Qwen3-4B-Thinking-2507 写成。Qwen3-4B-Base 学生在 10k、25k、50k 三个 SFT 规模上,10 个竞赛数学基准平均 pass@8 高 3.39 到 6.17 点。

RL 之前的诊断对上机制。Dolci-Think 选完 10 万条、尚未 RL,64 道后续会训到的数学题、每题 8 次:diverse checkpoint 有 54.7% 的题出现对错混杂,similar 是 46.9%,SFT 前 base 是 51.6%。平均正确率 diverse 还略低,但给 GRPO 留下学习信号的 prompt 更多。

OpenThoughts3、INTELLECT-3、Nemotron-Cascade 2 三个开源语料上,这个 CPU 选择器在平均后 RL 的 pass@1 和 pass@8 上,每一组都赢过随机、更简单的 topology 规则,以及梯度、embedding、词法选择,相对增益 1.2% 到 10.8%。相对同池 similar,每个数学基准都领先,平均准确率差 4.9 到 18.5 点。约 210 万条候选大约 3 个 CPU 小时;梯度或 embedding 基线要 64 到 232 GPU-hour。

对照指标结果
OLMo3-7B,SFT 未见环境后 RL pass@8Diverse 高 16.9 点
解题集合(8 次尝试)独有做对1133 vs 53
单教师,10 个数学基准平均 pass@8高 3.39 到 6.17 点
三开源语料 vs 更贵选择器平均后 RL相对增益 1.2% 到 10.8%
Qwen3-4B MATH-50012 教师 vs 1 教师 pass@165.08% vs 34.14%

为什么重要

已经在跑「验证解池 → 抽子集 SFT → RLVR」的团队可以直接改选择器,不用换损失,也不必为了多样性去凑更多教师。单教师池里差距还在。成本低到两百万条级用得起。

这是选数标准上的渐进改进,不是新训练算法。对准的卡点很具体:SFT 平均正确率高,并不等于 GRPO 好训;组相对方法吃的是「有对有错」的 prompt。

局限与存疑

局限写在 Appendix H,这次抽取没拿到那一节。方法附录里能核到的硬限制如下。

绝大多数对照是单次训练,Figure 1 也标明 single runs。正的后 RL 差值只说明同一 checkpoint 步上终点更好,并不单独证明 RL 阶段的提升幅度更大。指纹距离会掺进措辞,量的是可见步骤拓扑,并不清点语义上不同的算法。从路线库到单题成功率 p(x) 的那一环,论文写明没有直接测到。

Diverse 和 Similar 不必不相交。Similar 挤在质心附近,不是故意挑差解,长度和可读性上的系统差没有被拆开报告。程序模拟那一组比的是多模型语料对单模型语料,不能和主结论混读。覆盖缺口在中等难度、中等采样预算附近最大,两边接近饱和后会收窄。非 GRPO、非可验证领域、更大模型,没有做。

术语

原文与代码

相关论文

全部论文解读