RL 训练细节讨论:不用 PipelineRL 保 KV cache,反而选择重新 prefill
stochasticchasm · x · 2026-09-22
讨论一份 RL 训练配置的非常规取舍:
- 与 PipelineRL 保留旧 KV cache 的做法不同,该方案选择在策略更新后重新 prefill。作者推测原因可能是整个 rollout 只有约 30 步,每步策略变化较大,重新 prefill 值得。
- 配置本身相当标准,但作者还把大 batch size 的动机归结为提升 GPU 利用率,而非训练效果本身,这一点也被认为是 Interesting 的信号。
所属事件:百万级RL训练配置引热议:重prefill与大batch取舍(5 条相关)→
「Infra」频道最新
- 纯 C 零依赖引擎 COLIBRI:让消费级硬件跑 2.8T 参数 MoE 模型 — bibryam · 2026-09-22
- Sentdex 实测:openjev 在 GB10 延迟 169ms,3090 上 137ms — Sentdex · 2026-09-22
- PyroDash:小模型按需呼叫大模型,推理成本降96%反超单独用大模型 — jiqizhixin · 2026-09-22
- Underdog 推出 Husky 推理引擎,MacBook 上跑出 730 tokens/s — jimmykoppel · 2026-09-22
- peano_ai 在 1000+ TPU 上对 310B 模型跑通全参数 RL 训练 — simonguozirui · 2026-09-22
- Cloudflare Python Workers 结束两年预览正式可用 — Simon Willison · 2026-09-22