Google 研究:SFT 路径多样性选择可提升 RL 后泛化最高 16.9 点
google · hf · 2026-09-30
Google 发表研究,指出并非所有「已验证正确」的解答都对 RL 阶段同样有用,提出以推理路径多样性(route diversity)作为 SFT 数据选择标准。
方法:设计轻量的基于规则的「指纹」选择器(纯 CPU、无需模型调用),从同一数据池中选出推理步骤序列更多样的样本。
主要结果:
- 同一预算、同配方下,选多样而非相似路径,提升 post-RL 在谜题与数学上的问题覆盖率,包括难于两个训练阶段见过的问题。
- 合成实验中,route-diverse SFT 使 OLMo3-7B 在 held-out 环境的 pass@8 提升 16.9 点;单模型条件下,10 个数学基准平均 pass@8 提升最高 6.2 点。
- 机制解释:多样 SFT 虽平均准确率略低,但在更多 prompt 上同时产生成功与失败样本,给 group-relative RL 提供更多有学习信号的组。
在 3 个开源语料上,该选择器在所有对比中平均 post-RL 表现均优于更昂贵的替代方案。
「研究」频道最新
- RL with Confidence Margin 论文:让置信度逐步追踪推理正确性 — EliasEskin · 2026-09-30
- 阿里达摩院开源 WorldAttention:交互式视频世界模型高效注意力架构 — Alibaba-DAMO-Academy · 2026-09-30
- 南科大 ActFirst-OPD:先行动后思考,多轮智能体蒸馏训练提速最高 4.9 倍 — SouthernUniversityofScienceandTechnology · 2026-09-30
- 新加坡国立大学 MaLiang-Harness:用可执行程序控制图像视频生成,并定义 P2V 差距 — NationalUniversityofSingapore · 2026-09-30
- 美团 TGRL:温度分组强化学习,RLVR 训练速度提升最高 36% — meituan · 2026-09-30
- KAIST 提出 GRAFT:模型间互换轨迹,异构模型 RLVR 平均提升 2.1 分 — kaist-ai · 2026-09-30