激进 RL 配置引热议:30 步每步 2.5 万 rollout
一条关于强化学习训练超参数的讨论引发热议:有人贴出「30 个训练步、每步 25,000 个 rollout、async-4」的配置,Andrew Carr 等人直呼其激进(WILD)并向不懂 RL 的读者解释其含义。讨论中的核心观点认为,相比惊人的 rollout 数量,训练步数才是决定效果的关键因素。
2026-09-22 ~ 2026-09-22 · 3 条相关
- 30步×每步2.5万rollout的异步RL训练配置曝光 — willcb · 2026-09-22
- Anthropic 研究员曝光 RL 狂野配置:每步 2.5 万 rollouts — andrew_n_carr · 2026-09-22
- RL 训练配置激辩:30 步跑 2.5 万 rollouts 太野,步骤数才是关键 — willcb · 2026-09-22