贝叶斯强化学习新方法:参数空间探索提升 LLM 训练稳定性

BayesRL · hf · 2026-08-13

该项目提出了一种基于变分学习的参数空间探索方法,用于改进大语言模型(LLM)的强化学习(RLVR)。

通过扰动策略采样来实现参数空间的探索,这种方法能够有效增加 rollout 的多样性。与传统的动作空间探索方法相比,该方案显著降低了训练失败的风险,提升了模型训练的整体表现和稳定性。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →