大模型强化学习泛化不足?研究员指优化方向或有误

cjmaddison · x · 2026-07-30

针对「当前大模型的强化学习(RL)未能如预期般实现泛化」的观点,有研究人员指出,这种现象可能是因为 KL 散度的优化方向搞反了。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →