Google 研究:SFT 路径多样性选择可提升 RL 后泛化最高 16.9 点

google · hf · 2026-09-30

Google 发表研究,指出并非所有「已验证正确」的解答都对 RL 阶段同样有用,提出以推理路径多样性(route diversity)作为 SFT 数据选择标准。

方法:设计轻量的基于规则的「指纹」选择器(纯 CPU、无需模型调用),从同一数据池中选出推理步骤序列更多样的样本。

主要结果:

在 3 个开源语料上,该选择器在所有对比中平均 post-RL 表现均优于更昂贵的替代方案。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →