从业者讨论百万规模 RL 训练:标准 GRPO 为何不用 critic 模型
stochasticchasm · x · 2026-09-22
stochasticchasm 讨论某公司(在 100 万规模上做 RL)的训练配置:采用非常标准的 GRPO 形式,尚未引入一些团队已开始使用的 critic 模型。他猜测大批量训练足以让梯度噪声更小,因此即便不扩大 group size 也能奏效;同时好奇其中「behaviors」具体指什么——比如优化代码/性能的相对排序——希望公开的环境里会有更多细节。
所属事件:百万规模 GRPO 训练细节引发技术圈争论(3 条相关)→
「研究」频道最新
- Question's Gambit:检索前预处理让 GPT-5.5 深研成绩从 83.1% 升至 90.5% — omarsar0 · 2026-09-22
- PyroDash:小模型按需呼叫大模型,推理成本降96%反超单独用大模型 — jiqizhixin · 2026-09-22
- 不改权重、18MB KV 缓存即可按请求移除 LLM 拒答行为 — Anony6666 · 2026-09-22
- AI 数学证明该按什么标准?Lean ≠ ZFC,规则变更没经过投票 — jessi_cata · 2026-09-22
- 剑桥学者 David Krueger:四大根本问题未解,AI 安全不能指望限期攻关 — DavidSKrueger · 2026-09-22
- peano_ai 在 1000+ TPU 上对 310B 模型跑通全参数 RL 训练 — simonguozirui · 2026-09-22