RL 不止微调 SFT:更长预训练带来更陡峭的 RL 扩展曲线

gleech · x · 2026-08-24

研究指出 RL 不仅仅是锐化 SFT 策略:在简单谜题上,它放大了 SFT 已偏好的正确移动;而在困难谜题上,它挖掘出了 SFT 中几乎不存在的正确移动。此外,更长的预训练带来了更陡峭的 RL 扩展斜率。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →