30步×每步2.5万rollout的异步RL训练配置曝光

willcb · x · 2026-09-22

作者分享了一个相当激进的强化学习训练配置:30个训练步、每步25,000个rollout、异步并行度4(async-4),并感叹这是一组"疯狂"的参数。

这种大规模rollout配置通常用于需要大量环境交互的agent式RL训练,反映了当前RL训练基建在异步采样上的扩展玩法。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →