RL能学出可复用技能

heghbalz · x · 2026-07-10

这段继续讲 最终答案奖励 下的 RL 效果:即便没有中间步骤监督,RL 也能在留出题上解出基座模型几乎解不出来的问题。

作者解释其机制时给出的判断是:RL 先强化原始技能,再把这些技能组合成更复杂的过程,最后形成一个可以反复调用的稳定“工具箱”。

所属事件:探秘后训练:SFT与RL如何提升模型推理组合泛化(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →