研究者押注后训练阶段的离策略强化学习

andersonbcdefg · x · 2026-07-22

一位研究者表示,如果自己在做新实验室,会把重心押在 后训练阶段的离策略强化学习(off-policy RL) 上。

他的判断很直接:这条路未必能走通,但一旦跑通,可能会成为后训练优化里非常大的突破。帖子本身不是论文结果,更像是对下一代训练路线的押注与判断。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →