异步 RL 数据采集中被忽视的坑:任务耗时差异导致采样偏置

auto_grad_ · x · 2026-09-29

作者分享一个异步强化学习中少有人谈的数据采集细节:prompt 采样还需考虑任务完成耗时。若不同时分配 prompt,执行快的任务会在同样的调度窗口内更频繁地参与策略更新,慢任务的梯度占比被压缩,从而由异步调度本身制造出采样偏置。需要在 prompt 分发时按环境执行时间做平衡,避免快任务主导策略更新。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →