激进 RL 配置引热议:30 步每步 2.5 万 rollout

一条关于强化学习训练超参数的讨论引发热议:有人贴出「30 个训练步、每步 25,000 个 rollout、async-4」的配置,Andrew Carr 等人直呼其激进(WILD)并向不懂 RL 的读者解释其含义。讨论中的核心观点认为,相比惊人的 rollout 数量,训练步数才是决定效果的关键因素。

2026-09-22 ~ 2026-09-22 · 3 条相关