百万级RL训练配置引热议:重prefill与大batch取舍

一份在 100 万规模上进行 RL 训练的配置(疑为某公司环境/基础设施设计披露)引发 @stochasticchasm 等从业者讨论,焦点集中在其非常规的工程取舍上:一是未采用 PipelineRL(即保留旧 KV cache),而是选择在策略更新后重新 prefill;二是采用非常标准的 GRPO 形式,尚未引入部分团队已开始使用的 critic 模型,且未放大 group size。当前这些选择尚属推测性讨论而非定论,值得关注是因为它触及大算力下成本与训练效果的核心权衡。

已确认

尚未确认

为什么重要

2026-09-22 ~ 2026-09-22 · 5 条相关

一手来源