离策略训练的硬边界处理

ziv_ravid · x · 2026-07-11

这段在讲一个 off-policy 训练处理方案:他们直接丢掉旧 policy,用“当前 policy / rollout engine 的 logprobs”作为重要性比值;凡是超出双侧硬边界的样本,直接在梯度里被 mask 掉,而不是做普通 clipping。

核心意思是:在 agent 训练里,他们用更硬的筛选方式来控制离策略误差,而不是依赖温和裁剪。

所属事件:GLM团队提出SAO算法,突破智能体异步强化学习瓶颈(15 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →