贝叶斯强化学习新方法:参数空间探索提升 LLM 训练稳定性
BayesRL · hf · 2026-08-13
该项目提出了一种基于变分学习的参数空间探索方法,用于改进大语言模型(LLM)的强化学习(RLVR)。
通过扰动策略采样来实现参数空间的探索,这种方法能够有效增加 rollout 的多样性。与传统的动作空间探索方法相比,该方案显著降低了训练失败的风险,提升了模型训练的整体表现和稳定性。
「研究」频道最新
- NVIDIA提出SparDA架构:解码提速1.7倍,长文本推理更准 — HankYeomans · 2026-08-13
- Fast SAM 3D Body:实现实时全身 3D 人体网格恢复 — tom_doerr · 2026-08-13
- SkillZip:面向智能体技能库的图压缩方法 — Xingyu Tan · 2026-08-13
- 大模型加密推理链可被窃取:OpenAI、Anthropic、Google共享同一漏洞 — HuskyTheSniffer · 2026-08-13
- Flex-π 模型发布:融合 3D 与语义的机器人世界动作模型 — abhishekunique7 · 2026-08-13
- MCP安全扫描器盲区测试:单一得分极具误导性 — Resident_Exercise_22 · 2026-08-13