RL为何能提升SFT后的推理

burny_tech · x · 2026-07-12

这条转发在解释一篇论文对“为什么 RL 会在 SFT 之后改善推理”的看法:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →