从业者讨论百万规模 RL 训练:标准 GRPO 为何不用 critic 模型

stochasticchasm · x · 2026-09-22

stochasticchasm 讨论某公司(在 100 万规模上做 RL)的训练配置:采用非常标准的 GRPO 形式,尚未引入一些团队已开始使用的 critic 模型。他猜测大批量训练足以让梯度噪声更小,因此即便不扩大 group size 也能奏效;同时好奇其中「behaviors」具体指什么——比如优化代码/性能的相对排序——希望公开的环境里会有更多细节。

所属事件:百万规模 GRPO 训练细节引发技术圈争论(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →