开源 FlashREINFORCE:免critic单rollout异步RL实现6000+次稳定更新
YouJiacheng · x · 2026-09-14
开源项目 FlashREINFORCE 宣称为首个免 critic(critic-free)、单 rollout 的异步 LLM 强化学习方法,实现了 6000+ 次稳定更新。方法核心由三部分组成:One-Batch REINFORCE、Sequence Trust Region(序列信任域)以及 Sample-Mean Optimization(样本均值优化)。作者同时放出了论文与开源代码,转发者评价其为非常酷的工作。
「研究」频道最新
- 新论文:风格感知改写让文本匿名化,作者识别 F1 降 60-70% — chaumian · 2026-09-14
- 训练实践:batch size 4 实际是每步约 80 条轨迹 — cephaloform · 2026-09-14
- 用 16.6 万神经元果蝇大脑读 PDF,字符识别准确率 87% — llama_index · 2026-09-14
- 11 页短论文:群平均如何让 Ising 模型 MCMC 从缓速变快速 — michaelchchoi · 2026-09-14
- LLM 能否啃下 Collatz 猜想:耐心导航「数学迷宫」的新讨论 — an_interstice · 2026-09-14
- Proxy Policy Steering:不动权重、用残差引导 VLA 学新任务 — weichiuma · 2026-09-14